系统之家装机大师 7 月 29 日最新消息,月之暗面 7 月 28 日开源 2.8 万亿参数 Kimi K3 大模型当日,摩尔线程完成全栈兼容部署(0day 同步适配)。继昇腾之后,又一国产算力平台可承接全球前沿万亿级大模型落地。
Kimi K3 是全球首个开源的 3 万亿级别模型,总参数达 2.8 万亿,基于 KDA 混合线性注意力机制(Kimi Delta Attention)和注意力残差(Attention Residuals)技术构建,采用 Gated MLA 与 Stable Latent MoE 等架构创新,原生支持视觉理解,并拥有 100 万 token 上下文窗口。
与传统 Transformer 模型不同,Kimi K3 的 69 层 KDA 与 24 层 Gated MLA 构成混合注意力主干,Stable Latent MoE 以 896 个专家、每个 token 激活 16 个专家的方式提升模型容量。
面对新架构对 AI 芯片软件栈提出的系统性挑战,摩尔线程在模型开源后第一时间完成了模型结构解析、权重加载、核心算子、缓存管理与分布式运行链路的适配。针对 KDA 核心创新,团队分别完成了 Prefill 与 Decode 阶段的关键路径适配,并以 Triton MUSA 正确性实现作为稳定基线。SGLang-MUSA 同步适配了 Hybrid State Pool,用于管理 KDA 递归状态与卷积状态,覆盖 Prefix Cache、分块 Prefill 及 PD 分离场景所需的状态生命周期。
针对 Stable Latent MoE 的 896 专家、TopK 16 激活规模,摩尔线程快速完成了 DeepEP 适配,打通 token dispatch、combine 与跨卡 All-to-All 通信链路。MUSA 软件栈进一步完成模型路由、专家映射和分布式执行链路适配,通过 MCCL、DeepEP 与 MTSHMEM 协同承载张量并行、专家并行和低时延通信。面对 Kimi K3 官方 MXFP4 checkpoint,摩尔线程设计了加载期在线逐层量化方案,无需离线转换即可快速拉起推理。
获悉,MTT S5000 是摩尔线程基于第四代“平湖”芯片架构打造的 AI 训推一体智算卡,单卡 AI 稠密算力最高可达 1000TFLOPS,配备 80GB 显存,显存带宽达 1.6TB/s,卡间互联带宽为 784GB/s,完整支持从 FP8 到 FP64 的全精度计算。
系统推荐
1. 拥有超强的性能,专为“干重活”的专业用户设计(例如 CAD、动画、媒体制作者、图形设计团队等等),推荐你下载:Windows11 25H2 专业工作站版(前往下载)
2. 真正纯净的 Windows11 专业版系统,安装完成以后不捆绑软件,系统占用小。推荐你下载:Windows11 25H2 纯净专业版系统(前往下载)
3. 拥有五年超长生命周期支持的养老版,不频繁更新补丁,适合对稳定性要求高的企业用户。推荐你下载:Win11 24H2 LTSC 2024 企业版(前往下载)
4. 支持远程桌面主机、组策略管理等高级功能,适合对安全性、管理性和专业性有更高需求的用户。推荐你下载:Windows 11 25H2 专业版(前往下载)
以上是系统之家装机大师提供的最新资讯,感谢您的阅读,更多精彩内容请关注系统之家装机大师官网。