数码之家

 找回密码
 立即注册

QQ登录

只需一步,快速开始

搜索
查看: 45|回复: 0

[业界] 摩尔线程宣布完成Kimi K3适配:MTT S5000国产GPU支撑2.8万亿参数大模型

[复制链接]
发表于 1 小时前 | 显示全部楼层 |阅读模式

爱科技、爱创意、爱折腾、爱极致,我们都是技术控

您需要 登录 才可以下载或查看,没有账号?立即注册

x
IT之家 7 月 29 日消息,月之暗面 7 月 28 日正式开源 2.8 万亿参数模型 Kimi K3 并发布模型权重与技术报告。
同日,摩尔线程基于 AI 训推一体智算卡 MTT S5000 及 MUSA 软件栈,宣布完成 Kimi K3 的 Day-0 支持。
Kimi K3 是全球首个开源的 3 万亿级别模型,总参数达 2.8 万亿,基于 KDA 混合线性注意力机制(Kimi Delta Attention)和注意力残差(Attention Residuals)技术构建,采用 Gated MLA 与 Stable Latent MoE 等架构创新,原生支持视觉理解,并拥有 100 万 token 上下文窗口。
与传统 Transformer 模型不同,Kimi K3 的 69 层 KDA 与 24 层 Gated MLA 构成混合注意力主干,Stable Latent MoE 以 896 个专家、每个 token 激活 16 个专家的方式提升模型容量。
面对新架构对 AI 芯片软件栈提出的系统性挑战,摩尔线程在模型开源后第一时间完成了模型结构解析、权重加载、核心算子、缓存管理与分布式运行链路的适配。针对 KDA 核心创新,团队分别完成了 Prefill 与 Decode 阶段的关键路径适配,并以 Triton MUSA 正确性实现作为稳定基线。SGLang-MUSA 同步适配了 Hybrid State Pool,用于管理 KDA 递归状态与卷积状态,覆盖 Prefix Cache、分块 Prefill 及 PD 分离场景所需的状态生命周期。

针对 Stable Latent MoE 的 896 专家、TopK 16 激活规模,摩尔线程快速完成了 DeepEP 适配,打通 token dispatch、combine 与跨卡 All-to-All 通信链路。MUSA 软件栈进一步完成模型路由、专家映射和分布式执行链路适配,通过 MCCL、DeepEP 与 MTSHMEM 协同承载张量并行、专家并行和低时延通信。面对 Kimi K3 官方 MXFP4 checkpoint,摩尔线程设计了加载期在线逐层量化方案,无需离线转换即可快速拉起推理。
IT之家查询获悉,MTT S5000 是摩尔线程基于第四代“平湖”芯片架构打造的 AI 训推一体智算卡,单卡 AI 稠密算力最高可达 1000TFLOPS,配备 80GB 显存,显存带宽达 1.6TB/s,卡间互联带宽为 784GB/s,完整支持从 FP8 到 FP64 的全精度计算。





您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

APP|手机版|小黑屋|关于我们|联系我们|法律条款|数码之家-技术知识分享平台

闽公网安备35020502000485号

闽ICP备2021002735号-2

GMT+8, 2026-7-29 17:01 , Processed in 0.124800 second(s), 5 queries , Gzip On, Redis On.

Powered by Discuz!

© MyDigit.Net Since 2006

快速回复 返回顶部 返回列表