Topic 1 · Kimi K3 三连开源:2.8T MoE + AgentENV 分布式训练 + DSpark 423 tok/s
2026 年 7 月 27 日,月之暗面把 Kimi K3 的全部家当一次性放了出来:模型权重、高性能注意力内核、MoE 通信库、AgentENV 分布式训练环境,同一日交到开发者手上。这是开源世界第一次见到 3 万亿参数级的 MoE。
一、Kimi K3 是什么量级的模型
– 总参数 2.8 万亿,激活参数 16/896,是已公开开源模型里体量最大的 MoE – 1M token 原生上下文窗口,原生视觉理解(MoonViT3d 视觉塔) – 架构:69 层 Kimi Delta Attention(KDA)线性注意力 + 24 层 MLA 交错堆叠,搭配 896 专家 LatentMoE(3584 维 latent 空间路由) – 关键工程创新:Attention Residuals——每个 attention 输出被 bank 暂存后贯穿整个网络堆叠,绕开了标准层管线的假设 – 激活函数换成自研 SiTU(替代 SwiGLU),没有现成 MoE 内核可用,需要 LMSYS、RadixArk 这些团队从零写
模型 7 月 16 日先公布架构和成绩,7 月 27 日才放出权重;SGLang、Miles、Modal、Baseten 全部 Day-0 上线。
二、成绩单:赢在 Agent 和编码
K3 在「能不能干活」的 Agent 类基准上拿到了第一集团的位置:
| 基准 | K3 成绩 | 对比 |
|---|---|---|
| Frontend Code Arena | 1679 分,第一 | 比 Fable 5 高 48 分,6/7 领域第一 |
| BrowseComp | 91.2 | 压 Sol 90.4 和 Fable 5 88.0 |
| AutomationBench | 53% / 30.8 | 第一 |
| SWE Marathon | 42.0 | Fable 5 只有 35.0 |
| Program Bench | 77.8 | 第一 |
| DeepSearchQA (F1) | 95.0 | 第一 |
| SpreadsheetBench | 34.8 | 第一 |
| FrontierSWE | 81.2 | 比 Sol 高 10 分 |
| Terminal Bench 2.1 | 88.3 | 离 Sol 88.8 只差 0.5 分 |
Artificial Analysis 综合智能指数 57 分,排第四,排在 Fable 5(60)和两个 GPT-5.6 Sol 配置(59)之后。月之暗面自己写得很坦白:「K3 does not beat Fable 5 on general intelligence — but it competes」。在自家设计的 Kimi Code Bench 2.0 上,K3 反而把 Fable 5 排在自己前面(76.9 vs 72.9)——这个姿态在国产模型发布里不多见。
三、AgentENV:把大规模 Agent RL 训练做成开源基础设施
和模型权重一起放出的 AgentENV(kvcache-ai/AgentEnv)是这次开源的隐藏主角。它是一个大规模 Agent 训练用的分布式环境系统,组件支持 Kimi K3 的 Agent 强化学习训练,具备:
– 快速快照 / 恢复 / 分支,适合大规模并行 Agent 工作流 – 配合 Miles(RL 训练框架),12 小时内把 AIME-2024(greedy)从 43.3% 推到 76.7%,DAPO 数学(无 KL 项) – 训练器 / 部署引擎共置但互斥睡眠:base weights 永不移动,KV cache + CUDA graphs 在 trainer 工作时释放 – 适配器同步:只传输 BF16 LoRA adapters(2,800 张量),节省约 48 GiB/GPU 瞬时 IPC 内存 – 校验栈:Schulman k3 KL 估计(量化下限 ~2e-3)+ 金丝雀同步探针 + 张量级 dump + SHA256 manifests
AgentENV 把「给 Agent 写训练环境」这件事从闭门工程变成了 GitHub 开源仓库——以前 K2.5、K2.7 这种规模的 Agent RL 训练栈,没有任何一个开源项目能完整复现。
四、推理性能:DSpark 把单卡解码拉到 423 tok/s
LMSYS 和 RadixArk 团队写的 SGLang 后端把 K3 的推理优化做到了极致:
– batch-1 解码 ~113 tok/s(不推测解码,硬件 2×4 GB300) – 启用 DSpark 推测解码后 ~423 tok/s – 服务前沿 PP8→TP8 端 fp4 路径 2,808 tok/s/GPU – Agent 流量下 DCP8 较 TP8 把逻辑 KV 容量提升 ~7.9×(1.5M → 12.2M tokens),48 并发会话 541 tok/s – 草稿窗口从 512KB 砍到 16KB,约 32× 内存削减(ReplaySSM 技术)
工程亮点里有两个值得专门看:
1. 混合 KDA 内存管理:KDA 状态固定大小、原地覆写,跟 KV append-only 形成对比;统一内存池让 KDA state 从一端增长,MLA KV block 从另一端(KDA 块 ~54 MB vs MLA KV 块 ~27 KB,跨三个数量级) 2. Draft 步的 KDA 状态恢复:原本每步快照 K×V 状态(64 KB/请求/层/head),改成只存原始输入 Sᵢ = (vᵢ, kᵢ, gkᵢ, βᵢ) ≈ 1 KB,验证后单次 fold kernel 重放,bit-identical 验证通过
五、定价与门槛
– 托管 API:15 / M 输出 token——告别国产开源的低价路线,进入前沿闭源区间
– 自托管最低门槛:1.4 TB 聚合 GPU 内存,实际最低 8 节点 × 8× 80GB GPU(5.12 TB,留 KV cache 和 activations 余量)
– MXFP4 量化让内存带宽比 FP16 少约 4×,把成本结构做到中等组织也能跑
– 1M 上下文是 Allegretto 会员(199 元/月以上)专属
六、值得记住的几件事
K3 不是「另一个开源 MoE」:
– KDA + MLA 混合架构首次在 3T 级开源模型里跑通,Attention Residuals 是新的可借鉴设计 – AgentENV 把大规模 Agent 训练栈从闭门工程变成开源基础设施,对想做 Agent RL 的中小团队是降维打击 – MXFP4 + LoRA 协同原生支持——量化基础权重不动,BF16 LoRA 适配器叠加到量化基础 GEMM 上,未来针对 K3 做领域微调的门槛显著降低 – 月之暗面自己写「不开源就可能成为下一个 Fable 5」——19 天美国出口禁令阴影犹在,开源权重是结构性对冲
马斯克在 Artificial Analysis 推文下留了一句「Impressive」,Vercel CEO Guillermo Rauch 跑了 nextjs.org 综合 Web 工程评测,结论是「开放模型第一次领先全部专有模型」。Sriram Krishnan 把它称为「对整个行业具有多重影响的重大时刻」,Emad Mostaque 更直接:「美国实验室最终会去蒸馏中国模型。」
—
参考资料
– SGLang 和 Miles 为 Kimi K3 提供发布当日支持 – Kimi.ai X:模型权重发布 – Kimi.ai X:AgentENV 开源 – Kimi.ai X:Modal Day-0 DFlash 投机解码 – Kimi K3 模型解读:MXFP4 量化与开源意义 – 36 氪:K3 马斯克 Impressed – 腾讯新闻:2.8 万亿参数 K3 多项指标压过 Claude 与 GPT
