OpenRouter 8 月 10 日发布新版 Auto 路由器(openrouter/auto),宣布其路由策略从「自家调优的固定档位」切到「市场驱动 + 7 天滚动」:用每周超 55 万亿 token 的社区实际消费数据为每个 prompt 选模型。不卖新模型,不开新接口,只是把路由器本身变成一个活的市场指数——这是 AI coding 工具链第一次把「模型选择」这件事做成一个实时集体智慧问题,而不是 LLM 实验室或路由器厂商的内部判断。
运作机制拆开看,路线异常直白:
– 第一步:分类任务。 一个轻量级分类器在线上为每条 prompt 打上「~30 种细粒度任务类型」中的一种——code debugging、多步 agent planning、knowledge Q&A、math、customer support、research reports 等等。分类器是 fast / lightweight 的,in-flight 完成,prompt 不落盘。
– 第二步:按社区实际花销排名。 对当前任务类型,去看「过去 7 天 OpenRouter 社区在这个任务上实际把钱花在哪些模型上」。这就是「wisdom of the market」的核心——OpenRouter 手里有的不是 benchmark 分数,是真金白银的 55T token / 周。
– 第三步:套用 cost_tier。 用户可以传 cost_tier = low / medium / high / xhigh / max 五档,路由器在这个成本区间里挑当前市场份额最高的候选。低档走「能便宜就便宜」,max 档走「最贵但最猛」。如果用户有 allowed_models / guardrails / ZDR 隐私策略,路由会尊重它们。
– 第四步:sticky 多轮。 同一个会话(用 session_id 或消息 fingerprint 识别)会被优先留住上一次用的模型,只要它仍然是 top-N 候选;只有它跌出 top 才会切。这样避免「同一段代码 review 切三次模型」的浪费。
– 第五步:fallback。 分类器挂、排名系统挂,路由器自动回退到一组默认模型——「请求不会因为路由器失败而失败」。
这套策略在五个公开基准上的对照数据很有杀伤力(New Default = 新版 + cost_tier=low,Old Default = 旧版 + cost_quality_tradeoff=7):
| Benchmark | New Default | Old Default | New Max | Old Max |
|---|---|---|---|---|
| MMLU Pro(知识) | 85.2% ±0.3 | 86.6% ±0.1 | 91.4% ±0.3 | 88.8% ±0.3 |
| τ³-bench Banking(智能体) | 20.6% ±1.0 | 21.0% ±1.0 | 31.6% ±1.6 | 7.2% ±2.7 |
| WideSearch(搜索) | 61.6% ±2.6 | 53.1% ±2.6 | 61.9% ±2.4 | 54.8% ±2.6 |
| DSQA(研究) | 62.9% ±1.6 | 43.2% ±1.7 | 63.0% ±1.6 | 42.3% ±1.7 |
| SWE-Atlas QnA(编码) | 30.4% ±2.0 | 30.4% ±2.3 | 60.7% ±1.7 | 2.4% ±0.0 |
成本上的对照更直白:MMLU Pro 跑同一档 85% 的准确率,新版花 393.34(约 2.8 倍差距);SWE-Atlas 跑 max 档拿到 60.7% 准确率,新版花
205.52——旧版「省钱」是因为它没认真做这件事,直接退回到一组很弱但便宜的模型。
为什么这个更新值得拎出来单独讲?因为它把 AI coding 工具链里最难的一步——「给这个 prompt 选哪个模型」——从四个潜在决策方手里拿过来,统一交给「市场」:
– 模型厂商——Anthropic / OpenAI / Google / Meta 自己会宣称「我们这个模型适合 code」,但这是营销话术,benchmark 上的数字不等于生产场景的体感。
– 路由器厂商——传统路由器(Martian、Not Diamond、Portkey、Unify)通常跑的是「内部模型 + 内部 benchmark + 内部调优」,但它们的训练数据无法跟 OpenRouter 比——OpenRouter 一年处理的 token 比这些路由器厂商的客户量大几个数量级。
– 开发者——开发者写死的 if coding: claude-sonnet-4.5 elif agent: gpt-5 elif cheap: gpt-5-mini 是过去十年的做法,但「OpenRouter 用户每天在选什么」这条信号比任何 developer 的直觉都新。
– 下游工具厂商——Cursor、Devin、Replit Agent 这些 AI coding 工具自己做模型路由,问题是它们的选型数据来源局限于「自己用户用什么」,不是全市场。
新版 Auto 路由器把第 2、3、4 三个选项合并:它用市场花销作为单一信号源,让 prompt 自己选——这是过去 12 个月模型路由范式里最激进的简化。
具体落到 AI coding 工作流上:
– 「不知道该用哪个模型」这个心智负担被消除。 老规矩是:code 任务选 Sonnet,长上下文选 Gemini,写文档选 GPT-5-mini,agent 选 Opus——开发者要维护一份「什么时候用什么」的私有 mental map。新版 Auto 让 prompt 自己跑分类器、用市场信号选,开发者只需要传 cost_tier。
– 「新模型发布就过期」这个维护成本被消除。 旧版路由器需要定期人工加新模型、做 benchmark、调权重;新版路由器等 7 天——市场会自动把钱挪到新模型上,路由器跟着挪。
– 「我自己写 prompt 但用别人路由」这条赛道被强化。 OpenRouter 这次的赌注是:用户不在乎背后是哪个路由器,只在乎「我设的 cost_tier 是否被尊重」「sticky 行为是否管用」「fallback 是否稳」。
几件值得拎出来说的事:
– 市场信号的冷启动问题。 55T token / 周的总量是 OpenRouter 的护城河;任何想复制这条路的竞品(Martian、Unify、Portkey)拿不到同量级数据——这是 OpenRouter 把路由器做成「赢家通吃」的关键。
– sticky 行为是多轮体验的关键。 路由器不会因为新模型发布就强制切——它优先留住上次选的、只要还在 top-N。这意味着 AI coding 工具在做「跨多轮编辑同一段代码」时不会被中途换模型打断。
– cost_tier 的颗粒度比 quality_tradeoff 更人性化。 旧版是 0~10 数字(0 = 最贵最好、10 = 最便宜最差),新版是 low / medium / high / xhigh / max 五档。开发者传 low 就能拿到「便宜但能用」——比手动调 quality 7 直观。
– OpenRouter 的 beta 通道 openrouter/auto-beta 已经先于 stable 上线几周。 这意味着新路由器的策略调整比 stable 更激进——愿意吃螃蟹的开发者用 auto-beta,等稳定再切回 auto。
把这件事放进 8 月的 AI coding 工具链主线下,它跟另外几个事件串成一条很清晰的线:
– 8-06 OpenRouter ori CLI(topicId 178597114)——OpenRouter 把 CLI 工具做出来,让开发者用 13 个变量就完成「13 个 provider / 13 种环境变量」的接入。 – 8-06 Google API Gateway 模型路由(topicId 178597113)——Google 把「模型路由」集成到 API Gateway,让用户在网关层切换。 – 8-10 OpenRouter 新版 Auto 路由器(本文)——把「市场信号」作为路由决策的唯一信号源。
8-10 这一步是 OpenRouter 把「路由器」从「工具」做成「市场」的关键一刻——以后「AI coding 工具选哪个模型」这个问题,OpenRouter 押注市场会自动回答。
事件源:
– OpenRouter 公告:https://openrouter.ai/blog/announcements/introducing-the-new-auto-router
– OpenRouter Auto 路由文档:https://openrouter.ai/docs/guides/routing/routers/auto-router
– OpenRouter Rankings(任务花销页):https://openrouter.ai/rankings#task-spend
– OpenRouter openrouter/auto 模型页:https://openrouter.ai/openrouter/auto
– SWE-Atlas QnA 基准:https://github.com/scaleapi/SWE-Atlas
– MMLU Pro 基准:https://github.com/TIGER-Lab/MMLU-Pro
