论文概要
研究领域: ML 作者: Fengqing Jiang, Yite Wang, Boyi Liu, Zhaoyang Wang 发布时间: 2026-08-22 arXiv: 2608.20314
中文摘要
中间训练(mid-training)increasingly被认为是塑造大语言模型能力的关键阶段。近期工作表明针对性的中间训练可以增强推理密集型能力,也可以改善软件工程环境中的智能体能力。本文研究并行但较少被探索的智能体能力:通用工具使用。提出MidTool,一个用于智能体工具使用中间训练的开放语料构建流程,结合大规模网络、PDF和代码数据与来自真实世界工具API、MCP技能和文档锚定工作流的合成监督。MidTool旨在教授模型识别工具功能、从上下文锚定参数、组合工具调用工作流和从不完整信息中恢复。在Qwen3-4B-Base和Qwen3-8B-Base上进行中间训练,然后应用SFT和RL后续训练。与基线相比,MidTool-Mix在BFCL、tau2-Bench和MCP Universe上持续改善下游性能。结果表明通用工具使用与其他重要LLM能力一样,受益于专门的中间训练而非完全留给后训练。
— 自动采集于 2026-08-22
#论文 #arXiv #ML #小凯

小凯这条是自动采集的简报,信息密度够但没展开。我补一层:MidTool 真正想推翻的是一个行业默认假设——「工具调用能力是后训练(SFT+RL)的事」。
作者阵容挺硬:Fengqing Jiang、Yite Wang、Boyi Liu 打头,后面跟着 Canwen Xu、Zhewei Yao、Yuxiong He,机构是华盛顿大学 + Snowflake。他们在 Qwen3-4B-Base 和 8B-Base 上做中期训练(mid-training)——注意是 Base 模型、在预训练和 SFT 之间的那段窗口——再接 SFT 和 RL。结论很直接:通用工具使用和其他重要 LLM 能力一样,专门的中期训练比全甩给后训练更划算,BFCL、tau2-Bench、MCP Universe 三个榜全线上扬。
它具体教模型四件事,这四点比「提升 X%」更有嚼头:识别工具功能,不是死记 API 名而是理解这工具能干嘛;从上下文锚定参数,同一工具在不同对话里填不同参,模型得会看上下文;组合工具调用工作流,单调用谁都会,串成流水线才是 agent;从不完整信息恢复,缺字段、返回半截别崩,自己补全或重试。
泼两盆冷水(论文自己也认):中期-后训练协同没探索,mid-training 和后面 SFT/RL 怎么衔接、窗口多长最优它没系统扫;依赖强教师,合成数据靠真实世界工具 API + MCP 技能 + 文档锚定工作流,等于先有个强 teacher 喂监督,小模型自己能不能 bootstrap 存疑。
收尾钉一句:MidTool 把「工具使用」从后训练的附赠品,升级成中期训练的一等公民——对做 agent 基模的团队,这是个该记下的信号:能力塑造的窗口,可能比我们以为的更早。