你问编码代理一个方法的问题,它把五个文件整个读进上下文。几万 token 进去了,推理没走几步。Spotify 一位首席产品经理 Dimitri Mazmanov 9 月 3 日在工程博客里的判断很直接:”Most of what an AI coding agent does for me isn’t thinking. It’s I/O.”——它干的多数是搬运,不是思考。
搬运,就该按搬运的价钱付费。
这套架构长什么样
他的方案跑在 Spotify Portal 的 AiKA Modes 上。所谓 Mode,官方定义是”跑在临时运行时上的声明式 agent——可以理解成 agent 版的 AWS Lambda”:写清指令、挑好模型、挂上工具,剩下交给平台,不留状态、不管基础设施。
真正省钱的是分工。一个叫 shunt 的 Claude Code 插件装了两道确定性钩子:Read 碰到超过 350 行的文件就拦下,cat/head/tail 这类读大文件的命令也会被抓到。被拦下的脏活派给便宜模型(他的例子里是 Gemini 2.5 Flash)去读文件、出摘要;Claude 只拿摘要做推理。调试、架构决策、安全关键代码不外派,原样留给贵模型。博客里一句话说得很清楚:”The plugin decides when to delegate. The mode decides how to respond.”
决定权值得单独说。路由由行数阈值拍板,不由任何模型拍板。它笨,但可预测。
flowchart LR subgraph OLD[“改造前”] A1[“Claude 直接读文件”] –> A2[“五个文件全进上下文”] A2 –> A3[“按贵模型计价”] end subgraph NEW[“改造后”] B1[“超 350 行读取被拦截”] –> B2[“便宜模型读文件出摘要”] B2 –> B3[“Claude 拿摘要做推理”] end
作者在自己那个 Java 单仓上跑了四个场景,批量读取类的平均节省”around a whopping 90%”。
xychart-beta title “批量读取场景 token 消耗·作者自报” x-axis [“改造前”, “改造后”] y-axis “相对 token 量” 0 –> 110 bar [100, 10]
钱的背景
单看个人实验没意思,看行业的账。Gartner 的 Peer Insights 调查(经 ComputerWeekly 与 devops.com 转述):23% 的技术负责人报告每开发者每月 token 开销在 200 到 500 美元,约 6% 超过 2000 美元。我拿 2000 美元乘十二个月算了下,一年 2.4 万美元——这还只是 token 账单,没算限额换来的等待。
更狠的预测在 Gartner 今年 6 月的新闻稿里,也是博客原文链接到的那句:到 2028 年,AI 编码成本将超过开发者的平均工资。
pie showData title 技术负责人报的每开发者每月 token 开销 “200 至 500 美元” : 23 “超过 2000 美元” : 6 “其余档位” : 71
站里前阵子聊过 Claude Code 的周限额风暴(178634365 那帖),那是供给侧在收紧;Spotify 这套是需求侧在自救。两头一起挤,架构级的省 token 方案会越来越像标配。
冷水也得泼
九成这个数字,是他一个人、一个仓库、四个场景、只算批量读取的平均值。质量没测。时间跨度没写。他自己承认便宜模型漏了一个隐蔽的线程安全 bug——”Claude spotted it in seconds once given the right context.”
HN 上 239 分 151 条评论,最扎的几句都指向同一个地方。tetrisgm:”This is just offshoring but for models.”(模型版离岸外包。)gruez:全文没有任何准确率或实际性能数据,好歹跑个 DeepSWE bench。jnwatson 提醒得更实在:token 变少,是因为这部分消耗记到了另一个服务、另一个预算上——总账单没人给你看。
还有一层:Portal 本体是企业级收费产品(Spotify 托管的 Backstage 门户),开源的只有那两个 Claude Code 插件,仓库 7 月 23 日才建,76 颗星。想照抄的人,抄得走钩子和路由,抄不走平台。
【判断】这篇博客真正的贡献,是把模型路由从系统工程题变成配置题——”You don’t build infrastructure. You describe what you want and name it.”至于九成,那是他的仓库的数字。你的仓库多少,得自己量。
