8 月 11 日,微软把 MAI-Code-1.1-Flash 放进 GitHub Copilot。微软给出的关键词是“small-tier coding workhorse”,重点落在高频、交互式、能连续跑工具的工作流上,参数表退到了后面。
先把账算清
微软 AI 公告给出的几组数字很直接:
– Terminal-Bench 2.1(GitHub Copilot CLI)提升 22%; – .NET 任务提升 15%; – 代码能顺利走到 commit 阶段的“代码存活率”提高 4%,回访率增加 9%; – token 流速快 25%,完成同一任务所需 token 少 25%; – 相对上一代,供应商标价降为 四分之一。
GitHub 的上线公告还补了一层产品信息:1.1-Flash 支持原生图像输入,并进入 Copilot CLI、Copilot cloud agent、GitHub Copilot app、VS Code、Visual Studio、GitHub Mobile、JetBrains IDEs、Eclipse 和 Xcode。个人版可以看到自动选择,Pro、Business、Enterprise 等套餐可手动选择;企业策略默认关闭。
这里的“便宜”有两个口径。官方把 1.1-Flash 的价格写成上一代的四分之一,同时 GitHub 公告说明年付用户按 0.25× premium request multiplier 计费,具体仍要看 Copilot 的实际套餐和请求类型。读新闻时不能只截“四分之一”三个字,便把它理解成所有用户的总价都自动变成 25%。
模型能力藏在工作流里
视觉输入是这次更新最容易看见的变化。Agent 现在可以先看截图、图表、错误页面,再决定改哪段代码。它解决的是“上下文”的一部分:代码、图像、操作记录和工具调用需要被放在同一个循环里。
成本与速度同时改善,才是这次更新最硬的信号。对普通聊天,价格低一点只是少花几美元;对会在仓库里反复读文件、跑测试、开多个 session 的 agent,每一轮少 25% token,累计差异会直接落到任务预算和响应延迟上。微软称训练和推理效率来自数十万计的 Copilot 强化学习环境,这类“在真实运行轨迹上回炉”比把一个静态 benchmark 拉高几分更像产品路线。
当然,公告里的 Terminal-Bench、.NET 和生产指标都来自微软自己的评测体系。公开材料没有给出每个测试的完整复现实验、上下文长度、工具失败率和按任务类型的成本,22% 不能外推为所有代码任务都变快 22%。代码存活率也不是“修 bug 更准”的同义词,它只说明生成的改动通过了更多后续检查。
编码工具的下一道题
这件事真正推动的,是编程模型评价标准的迁移。模型参数仍重要,但 agent 的成本由一串动作决定:读仓库、列计划、改文件、调用工具、检查 diff、跑测试、修复失败。少做一轮无效循环,比多会一道面试题更值钱。
Copilot 把 1.1-Flash 铺到 CLI、云端 agent、IDE 和移动端,等于把“低价快速模型”放进了同一条软件交付链。它不会自动替代高推理模型:复杂架构、安全审计和长链路迁移仍需要更强的模型反复核验。较合理的分工是,让小模型承担大量读、改、测的周转,把高成本模型留给高风险决策。
接下来最值得观察的,是企业是否真的把它接入固定工作流,并公开记录“一次任务用了多少 token、花了多少分钟、失败后是否需要人工接手”。排行榜再进几名,反倒是小事。这才是 coding agent 的生产率。
来源与可复核链接
1. Microsoft AI:MAI-Code-1.1-Flash 官方公告 https://aka.ms/mai-code-1.1-flash 2. Microsoft MAI-Code 官方仓库 https://github.com/microsoft/MAI-Code 3. GitHub Copilot 上线公告 https://github.blog/changelog/2026-08-11-mai-code-1-1-flash-available-in-github-copilot
