开源 Agent 的两条路:Qwen3.8-27B 把大脑装进显卡,DeepSeek-V4-Flash 把成本压到地板

把 Qwen3.8-27B(27B)和 DeepSeek-V4-Flash(284B)摆在一起比 Agent ...

把 Qwen3.8-27B(27B)和 DeepSeek-V4-Flash(284B)摆在一起比 Agent 能力,第一反应一定是「以小搏大」。但这两个模型根本不是同一物种——它们恰好诠释了 2026 年「开源」这个词分裂出的两种相反含义。比 Agent 不能比参数规模,得比「任务长什么样」。

一、两个开源,两种意思

DeepSeek-V4-Flash 是 MoE 架构:2840 亿总参,每 token 只点亮 130 亿,附 DSpark 推测解码,MIT 许可,纯文本,原生 1M 上下文、最大输出 384K。代价是权重在 FP4 下约 160GB,得服务器级 GPU 才跑得动——所以实际几乎人人租用。

Qwen3.8-27B 是稠密 27B(64 层里 48 层 Gated DeltaNet + 16 层全注意力 + MTP),Apache-2.0,原生多模态(文本 + 图像 + 视频),量化后单卡 16GB 可跑、8GB 卡也能跑。它把旗舰 Agent 能力下沉到了开发者桌面的显卡上。

这里有个反直觉的洞见:DeepSeek 名义 284B,每 token 只点亮 13B,不到 Qwen 全量 27B 的一半。按每 token 算力算,Qwen 反而是更「重」的那个。这正是 DeepSeek 能把单价压到地板、而 27B 在日常体感上「比 13B-active 模型更像大模型」的根因。

二、工具调用:Agent 的命门

一个连 JSON 参数都填错的模型,规划再好也是空中楼阁。这一项上两家走了不同路。

Qwen3.8-27B 在预训练阶段就做了 Agent-aware 架构设计:工具描述用 Schema Embedding token 化、直接集成 Toolformer-style action head、并用 Action Consistency Loss 强制同一工具调用生成一致参数签名。OpenRouter 生产流量实测,它的工具调用错误率仅 1.06%——但结构化输出错误率 17.52%,JSON 格式仍是短板。Qwen 家族长期是开放权重工具调用榜单(Berkeley BFCL)的霸主,27B 是推荐档。

DeepSeek-V4-Flash 经 7 月 31 日重做后训练专攻工具使用,Toolathlon Verified 从预览版 51.8 升到 70.3(第一梯队),并原生支持 Responses API 与 Codex 定向调优。但它有开发者必踩的坑:带 tools 的请求必须把 reasoning_content 完整回传,否则 API 返回 400;官方 JSON 模式偶发空内容(文档自认的 open bug)。

三、代码与终端:V4 Flash 略胜,同尺寸 Qwen 碾压前代

Terminal-Bench 2.1:DeepSeek-V4-Flash 82.7,Qwen3.8-27B 73.0。DeepSWE 1.1:54.4 对 42.2。纯文本 Coding / 终端维度,DeepSeek 整体领先约 10 分,且它从预览版 DeepSWE 7.3 暴涨六倍多。

但 Qwen 在「写完并通过测试」类任务上亮眼:LiveCodeBench v6 拿 90.3(超 Opus 4.6 Max 的 88.8),SWE-bench Pro 61.7(用 Claude Code harness 重跑,超 Opus 4.6 Max 的 53.4)。关键不是绝对值,是「27B 干翻规格更大的自家 3.7-Plus 与部分闭源旗舰」这件事本身——Agent 能力正在从巨型模型独占,下沉到消费级显卡能跑的尺寸。

四、computer-use:Qwen 的独家地盘

这一项是两者最硬的分叉。Qwen3.8-27B 因原生多模态,能直接吃截图 / UI 图做 computer-use agent:OSWorld-Verified 84.3(超 Opus 4.6 Max 72.7)、AndroidWorld 81.9、WebArena-Verified 64.8、SWE-MM 38.6。

DeepSeek-V4-Flash 是纯文本,物理上无法做 screenshot-driven 的电脑操作。它的 Agent 强项永远在文本态的终端、代码库、长文档检索。凡是任务含「看屏幕 / 看图 / 看视频」,Qwen 是唯一能打的。

五、去厂商滤镜:第三方同台锚点

所有官方数字都来自各自 harness,需要独立校正。WildClawBench(OpenClaw 同台,60 个 Agent 任务)给 Qwen3.8-27B 打出 48.0%,33 个模型中排第 15——官方 73/84 类数字在更克制 harness 下「打折」到约一半,属正常落差,但仍显著强于前代。DeepSeek V4 Flash 暂无同台精确分,但有 Artificial Analysis 独立背书:0731 后 AA 智能指数 50、LMArena hard 约 1459 Elo,且独立 Terminal-Bench 跑出 79%(vs 官方 82.7,落差极小,可信度高)。Qwen 当前最大短板恰恰是——暂无独立智能指数,每个数字都还是阿里自报、未独立复现。

六、成本经济学:比完成率,不比单价

行业共识很明确:别只比每百万 token 单价,要比「完成一项任务需要多少轮、多少 token、多少次失败重试」。DeepSeek-V4-Flash 首方 cache-miss 价 0.14/0.28,且 2026-08-16 起改尖 / 离峰两段(离峰半价);Qwen3.8-27B API 价 0.45/3.20,但自托管近乎零成本、数据不出域。两者本可互补路由:DeepSeek 接长上下文文本终端、Qwen 接含图视频任务,自托管 Qwen 作基线、租用作突发。

七、它改变了什么

这件事的信号不在几张分数,而在行业风向:过去 Agent 能力基本捏在闭源超大模型手里,想用完整智能体就得依赖云端 API;如今开源厂商把核心能力下放到了数百亿参数的稠密模型,27B 成了公认的「黄金档」——硬件可控、推理稳、兼顾多模态与超长上下文。

但务必清醒:在 WildClawBench、SWE-bench Verified 这类端到端榜上,二者都明显落后 Opus 4.7 / GPT-5.5 / GLM-5.1 等闭源旗舰,开放权重在 agentic 上仍差 20+ 分。更关键的是,Agent 框架(scaffold)对分数的影响可达 22%,模型选择仅约 1%——先搭好 harness,再优化模型。

关键数据点

– 架构:DeepSeek 284B MoE / 13B active(MIT,~160GB);Qwen 27B 稠密(48 DeltaNet + 16 注意力,Apache-2.0,单卡 16GB) – 工具调用:Qwen OpenRouter 错误率 1.06%(结构化输出 17.52%);DeepSeek Toolathlon 70.3 – 终端 / 代码:Terminal-Bench 82.7 vs 73.0;DeepSWE 54.4 vs 42.2;Qwen LiveCodeBench 90.3、SWE-bench Pro 61.7 – 多模态 Agent:Qwen OSWorld 84.3、AndroidWorld 81.9(DeepSeek 纯文本缺席) – 第三方锚点:WildClawBench Qwen 48.0%(15/33);DeepSeek AA Index 50、独立 Terminal 79% – 成本:DeepSeek 0.14/0.28(尖/离峰);Qwen 自托管≈0

必须警惕的限制

1. 全部基准为厂商自测 harness,无同一 harness 同任务公开 head-to-head,生产前必自测。 2. Qwen 暂无独立智能指数,数字待第三方复现;DeepSeek 虽有 AA 背书但仍属厂商 harness。 3. DeepSeek 接入坑:带 tools 须回传 reasoning_content(否则 400),JSON 模式偶发空内容。 4. Qwen 结构化输出错误率 17.52%,强 JSON 场景需程序侧 schema 校验兜底。 5. 多步任务准确率复利下滑(单 call 90% → 5 call 后约 59%),Agent 须内置重试 + 反馈 + 参数校验。 6. Qwen 本地部署 80K token 以上实测变慢、偶重复,长上下文 agent 需控显存与分段。

发表回复

人生梦想 - 关注前沿的计算机技术 acejoy.com 🐾 步子哥の博客 🐾 背多分论坛 🐾 借一步网 🐾 智柴网 沪ICP备2024052574号-1