话题 3:Microsoft MAI-Thinking-1 上线 Foundry —— 微软首款推理模型,用「零蒸馏」路线正面撞向 Anthropic Sonnet 4.6

## 数据点 微软 AI 负责人 Mustafa Suleyman 8 月 17 日在 X 上宣布 MAI-T...

数据点

微软 AI 负责人 Mustafa Suleyman 8 月 17 日在 X 上宣布 MAI-Thinking-1 正式登陆 Microsoft Foundry——这是微软首款从零构建的推理模型。模型规模上,开源版的总规模达到 1T(活动参数约 350 亿、上下文 128K),微软宣称「零蒸馏」(Zero Distillation)——所有 MAI 模型均不依赖任何第三方(如 OpenAI GPT 系列)的输出来训练,三阶段流程是 mid-trained base → 三个 specialist RL(STEM / 编程等)→ trace-distillation SFT → 最终一轮 RL。同批上线的还有 MAI-Code-1-Flash,瞄准 GitHub 场景,主打低成本高效率编码。

战绩层面:MAI-Thinking-1 在 SWE-Bench Pro 上拿到 0.528 分(行业第 40 名附近),在 AIME 2026 数学竞赛基准上以 0.945 的成绩排到并列第 9。微软对外口径是「编码能力大致对标 Anthropic 2 月发布的 Claude Sonnet 4.6」。Suleyman 当天在受访时把这个战略挑明了:「我们走的是 Anthropic 风格——企业、开发者、编码。」

它解决了什么

「零蒸馏」是 Mustafa 反复强调的路线选择。这条路线要解决的是知识蒸馏方法的天花板问题:学生模型的知识完全来自教师模型,缺乏从原始数据中发现新规律的能力;教师模型的偏见或错误会被直接继承;能力上限无法超越教师。微软拿这套框架来推的是三个工程目标——更强的可控性与安全性(训练数据、算法流程完全自主,便于做安全对齐与合规审查)、摆脱对现有模型模式的模仿(可能在逻辑链推理、数学计算、代码生成等任务上形成差异化优势)、以及减少对外部模型技术的依赖以构建独立 AI 技术栈。

在「零蒸馏」之外,微软这次的做法更接近 DeepSeek R1 而非 V4——先在一个中训练基础模型上做 3 个领域的 specialist RL,再做 trace-distillation SFT 把专家能力合并,最后做一轮最终 RL。这里关键是 trace-distillation 把专家的推理轨迹拆解为「SFT 文本」让模型模仿,而不是 on-policy 的 MOPD。Nathan Lambert 对此评价「保守」,但微软 AI 高管 Finbarr 的反驳也很有分寸:新团队刚开始做 post-training 时,选择保守其实更明智,因为试图一次性做太多改动很容易让整个流程崩溃。

它改变了什么

微软这步棋的战略含义比模型本身的分数更高。Anthropic 的 Sonnet 4.6 是当前企业级编码推理的标杆之一,MAI-Thinking-1 用「零蒸馏」「自给训练基础设施」「clean traceable data」三个标签做成差异——这把模型从「能力展示品」变成「企业合规品」。对金融、医疗、政府这类对数据来源和训练链路可审计有强要求的场景,「零蒸馏」是可以写进采购要求书的技术条件。

这步棋也意味着微软在 AI「自主化」路线上跨过了关键拐点。在继续保留与 OpenAI 深度合作的同时,微软正在加速打造自己的前沿模型体系——MAI-Thinking、MAI-Code-1-Flash,加上同步更新的 MAI-Image-2.5(支持 4K 图像)和更早的语音 / 转录模型,已经搭出一个覆盖文本、图像、语音的完整多模态栈。「大脑」完成之后是「身体」——微软同周对 Windows 365 云桌面服务也做了史上最大规模更新,把企业级智能体部署的安全底座一并搭起来。

下一步验证窗口期很短:6 个月内看 MAI-Thinking-1 在企业级编码工作流里(GitHub Copilot 后端、定向代码评审工具、IDE 集成)的真实付费采纳;12 个月内看「零蒸馏」是否被写进欧盟、美国之外主要市场的 AI 采购合规框架。

参考来源:x.com/mustafasuleyman、llm-stats.com、warsawainews.substack.com、71396.com

发表回复

人生梦想 - 关注前沿的计算机技术 acejoy.com 🐾 步子哥の博客 🐾 背多分论坛 🐾 借一步网 🐾 智柴网 沪ICP备2024052574号-1