「AgentSky 引爆编码代理性价比之战:同一任务 Claude Code 花 150 美元,DeepSeek harness 仅 2 美元」
> 当一次 Agent 任务的成本可以相差 75 倍,”每百万 Token 解决多少任务”正在取代”模型跑分”,成为更硬的选型指标。
一、一条 135 万浏览的推文,撕开了成本黑箱
8 月 25 日,开发者 @quxiaoyin 发布了一个叫 AgentSky 的对比平台,并贴出同任务横向实测:在一项相同的 coding 任务上,Claude Code 花费约 150 美元,而 DeepSeek 的 harness 方案只花了约 2 美元——差距接近 75 倍。这条推文浏览量冲到 135 万+,@svpino 将其类比为”Agent 版的 OpenRouter”:它把 Claude Code、Codex 等不同编码代理并排跑同一个任务,统一回收账单与 diff,让性价比第一次变得可量化。
flowchart LR A[过去:模型跑分选型] –> B[关注 benchmark / 榜单名次] A –> C[厂商堆参数、刷榜] B –> D[现在:经济性选型] D –> E[每百万Token解决多少任务] D –> F[AgentSky统一回收账单+diff] F –> G[性价比可排序]
二、为什么是现在?Agent 的 token 账单失控了
OpenRouter 数据显示,真实的 Agentic 请求平均消耗的 token 是普通聊天的 15 倍;一个代码 Agent 的上下文会在任务推进中从约 6 万涨到接近 40 万 token,还不断穿插子 Agent 调用。于是”模型谁更强”的叙事,正在让位于”成本与协作形态”:语音 Agent(OpenAI Devs 预告 Codex 语音免键盘工作流)、跨工具记忆、本地化执行成为新热点。同期 @alvarombt 还揭露 Codex 的某些使用限制被 harness 绕过、导致高额 token 消耗,OpenAI 随后调整了策略。
sequenceDiagram
participant U as 用户
participant S as AgentSky
participant C as Claude Code
participant D as DeepSeek harness
participant X as Codex
U->>S: 提交同一 coding 任务
S->>C: 派发任务
S->>D: 派发任务
S->>X: 派发任务
C–>>S: 返回 diff + 账单 2
X–>>S: 返回 diff + 账单 $?
S–>>U: 并排对比性价比排名
三、字节的回应:把”编程+智能体+办公”塞进一个豆包
同一天,字节跳动完成 AI 产品线整合——TRAE 编程工具、扣子(Coze)智能体平台并入豆包,并推出”豆包工作”:围绕用户目标自主拆解任务、调用工具、推进工作流,与飞书深度打通。这标志着国内大厂的竞争从”单点模型”切换到”全栈生产力平台”:模型—工具—办公的闭环。
graph TB P[编码代理性价比战场] –> Q1[AgentSky类对比平台:量化每任务成本] P –> Q2[harness成本契约:Muse Code/Orca ADE按贡献档定价] P –> Q3[全栈平台:豆包工作=TRAE+扣子+飞书] Q1 -.倒逼.-> R[厂商从堆参数转向降单位成本] Q2 -.倒逼.-> R Q3 -.倒逼.-> R
四、值得关注的逻辑
编码代理的竞争规则变了。过去比 benchmark、比刷榜;现在比”同样一件事,谁花得更少”。AgentSky 这类对比平台会把战场拉到可量化的经济性维度。这与近期 Orca ADE 的并行编队、各家 harness 的成本契约,是同一股潮流的不同切面——Agent 时代的胜负手,正从”模型力”位移到底层的”经济性基础设施”。
参考来源
– 稀土掘金《AI 日报 2026-08-25》 – AGI HUNT · AI News Daily 2026-08-25 – 腾讯新闻《OpenClaw 快讯》《AI Agent 动态日报》8/25 – Smartotics AI Daily Report 2026-08-25

我常说一句话:你不会因为一把锤子够不够亮买它,你只看它把钉子敲进去要花多少力气。AgentSky 这事儿,就是把 coding agent 的“力气账单”第一次摊开给人看。
一条 135 万浏览的推文干了件事:同一个 coding 任务,Claude Code 花了约 150 美元,DeepSeek 的 harness 方案只花约 2 美元,差了将近 75 倍。它把 Claude Code、Codex、DeepSeek、Kimi 们并排跑同一个任务,统一回收账单和 diff——有人管这叫“Agent 版的 OpenRouter”。
几个数字得摆正:
– DeepSeek V4 Flash 每百万 token 只要 0.21/0.42 美元(输入/输出),Claude Sonnet 4.6 是 3/15,差出十倍到几十倍;
– 真实 Agentic 请求平均吃掉的 token 是普通聊天的 15 倍,一个代码 agent 上下文能从 6 万涨到近 40 万,还不断叉出子 agent;
– AgentSky 的 Arena 已经攒了 40,835 个任务的横向数据。
字节同一天把 TRAE、扣子、飞书揉进“豆包工作”,标志着国内大厂从“单点模型”切到“全栈生产力平台”。
反自欺:150 vs 2 是“同一任务”的实测,但任务难度、成功率、产出代码质量没在标题里——便宜 75 倍如果只做对一半,账单优势就打折了。
收尾钉子:等 AgentSky 把“每美元解决的任务成功率”做成可排序的公开榜单,模型跑分时代就真结束了——那时选 agent 看的是单价,不是打分。