「AgentSky 引爆编码代理性价比之战:同一任务 Claude Code 花 150 美元,DeepSeek harness 仅 2 美元」

# 「AgentSky 引爆编码代理性价比之战:同一任务 Claude Code 花 150 美元,DeepS...

「AgentSky 引爆编码代理性价比之战:同一任务 Claude Code 花 150 美元,DeepSeek harness 仅 2 美元」

> 当一次 Agent 任务的成本可以相差 75 倍,”每百万 Token 解决多少任务”正在取代”模型跑分”,成为更硬的选型指标。

一、一条 135 万浏览的推文,撕开了成本黑箱

8 月 25 日,开发者 @quxiaoyin 发布了一个叫 AgentSky 的对比平台,并贴出同任务横向实测:在一项相同的 coding 任务上,Claude Code 花费约 150 美元,而 DeepSeek 的 harness 方案只花了约 2 美元——差距接近 75 倍。这条推文浏览量冲到 135 万+,@svpino 将其类比为”Agent 版的 OpenRouter”:它把 Claude Code、Codex 等不同编码代理并排跑同一个任务,统一回收账单与 diff,让性价比第一次变得可量化。

flowchart LR A[过去:模型跑分选型] –> B[关注 benchmark / 榜单名次] A –> C[厂商堆参数、刷榜] B –> D[现在:经济性选型] D –> E[每百万Token解决多少任务] D –> F[AgentSky统一回收账单+diff] F –> G[性价比可排序]

二、为什么是现在?Agent 的 token 账单失控了

OpenRouter 数据显示,真实的 Agentic 请求平均消耗的 token 是普通聊天的 15 倍;一个代码 Agent 的上下文会在任务推进中从约 6 万涨到接近 40 万 token,还不断穿插子 Agent 调用。于是”模型谁更强”的叙事,正在让位于”成本与协作形态”:语音 Agent(OpenAI Devs 预告 Codex 语音免键盘工作流)、跨工具记忆、本地化执行成为新热点。同期 @alvarombt 还揭露 Codex 的某些使用限制被 harness 绕过、导致高额 token 消耗,OpenAI 随后调整了策略。

sequenceDiagram participant U as 用户 participant S as AgentSky participant C as Claude Code participant D as DeepSeek harness participant X as Codex U->>S: 提交同一 coding 任务 S->>C: 派发任务 S->>D: 派发任务 S->>X: 派发任务 C–>>S: 返回 diff + 账单 150     D-->>S: 返回 diff + 账单2 X–>>S: 返回 diff + 账单 $? S–>>U: 并排对比性价比排名

三、字节的回应:把”编程+智能体+办公”塞进一个豆包

同一天,字节跳动完成 AI 产品线整合——TRAE 编程工具、扣子(Coze)智能体平台并入豆包,并推出”豆包工作”:围绕用户目标自主拆解任务、调用工具、推进工作流,与飞书深度打通。这标志着国内大厂的竞争从”单点模型”切换到”全栈生产力平台”:模型—工具—办公的闭环。

graph TB P[编码代理性价比战场] –> Q1[AgentSky类对比平台:量化每任务成本] P –> Q2[harness成本契约:Muse Code/Orca ADE按贡献档定价] P –> Q3[全栈平台:豆包工作=TRAE+扣子+飞书] Q1 -.倒逼.-> R[厂商从堆参数转向降单位成本] Q2 -.倒逼.-> R Q3 -.倒逼.-> R

四、值得关注的逻辑

编码代理的竞争规则变了。过去比 benchmark、比刷榜;现在比”同样一件事,谁花得更少”。AgentSky 这类对比平台会把战场拉到可量化的经济性维度。这与近期 Orca ADE 的并行编队、各家 harness 的成本契约,是同一股潮流的不同切面——Agent 时代的胜负手,正从”模型力”位移到底层的”经济性基础设施”

参考来源

– 稀土掘金《AI 日报 2026-08-25》 – AGI HUNT · AI News Daily 2026-08-25 – 腾讯新闻《OpenClaw 快讯》《AI Agent 动态日报》8/25 – Smartotics AI Daily Report 2026-08-25

一条评论

  1. 我常说一句话:你不会因为一把锤子够不够亮买它,你只看它把钉子敲进去要花多少力气。AgentSky 这事儿,就是把 coding agent 的“力气账单”第一次摊开给人看。

    一条 135 万浏览的推文干了件事:同一个 coding 任务,Claude Code 花了约 150 美元,DeepSeek 的 harness 方案只花约 2 美元,差了将近 75 倍。它把 Claude Code、Codex、DeepSeek、Kimi 们并排跑同一个任务,统一回收账单和 diff——有人管这叫“Agent 版的 OpenRouter”。

    几个数字得摆正:
    – DeepSeek V4 Flash 每百万 token 只要 0.21/0.42 美元(输入/输出),Claude Sonnet 4.6 是 3/15,差出十倍到几十倍;
    – 真实 Agentic 请求平均吃掉的 token 是普通聊天的 15 倍,一个代码 agent 上下文能从 6 万涨到近 40 万,还不断叉出子 agent;
    – AgentSky 的 Arena 已经攒了 40,835 个任务的横向数据。

    字节同一天把 TRAE、扣子、飞书揉进“豆包工作”,标志着国内大厂从“单点模型”切到“全栈生产力平台”。

    反自欺:150 vs 2 是“同一任务”的实测,但任务难度、成功率、产出代码质量没在标题里——便宜 75 倍如果只做对一半,账单优势就打折了。

    收尾钉子:等 AgentSky 把“每美元解决的任务成功率”做成可排序的公开榜单,模型跑分时代就真结束了——那时选 agent 看的是单价,不是打分。

发表回复

人生梦想 - 关注前沿的计算机技术 acejoy.com 🐾 步子哥の博客 🐾 背多分论坛 🐾 借一步网 🐾 智柴网 沪ICP备2024052574号-1