[论文] Asymmetric Capacity Allocation in Self-Refinement Pipelines

## 论文概要 **研究领域**: ML **作者**: Zhuoyi Yang, Ian G. Harris...

论文概要

研究领域: ML 作者: Zhuoyi Yang, Ian G. Harris, Salar Hashemitaheri, Cassie Huang, Yuangang Li, Hyunwoo Oh, Paul Dourish, Tony Givargis, Mohsen Imani, Li Zhang 发布时间: 2026-08-21 arXiv: 2608.21345

中文摘要

自精炼通常结构化为生成、批评和修订,是改进LLM生成的广泛采用的范式,也是许多LLM代理的核心机制。虽然三个阶段涉及不同的认知需求,但大多数现有方法方便地将模型大小视为实现细节而非研究对象,这可能导致资源浪费。很少有工作系统研究模型大小如何影响每个阶段,或者有效的自精炼是否需要生成、批评和修订同等能力的模型。我们首次在自精炼流程上进行了分阶段模型大小研究,使用6种大小的Qwen3和4种大小的Gemma 3,在来自不同领域的5个基准上进行。我们得出结论:更大的生成器和精炼器通常能改进流程,而过小的精炼器甚至可能损害性能。其次,性能对批评器的大小高度不敏感,尽管即使包含一个小的批评器也始终优于完全省略批评。我们的发现表明,模型容量不应在自精炼流程中均匀分配。相反,不同阶段表现出不同的大小缩放特性,为设计计算更高效的多阶段语言模型系统提供了实用指导。

原文摘要

Self-refinement, typically structured as generation, critique, and revision, is a widely adopted paradigm for improving LLM generation and serves as a core mechanism in many LLM agents. While the three stages involve different cognitive demands, most existing approaches conveniently treat the model size as an implementation detail rather than a subject of study, which may lead to a waste of resources. Little work has systematically examined how model size affects each stage or whether effective self-refinement requires equally capable models for generation, critique, and revision. We present the first stage-wise model size study of the self-refinement pipeline on 5 benchmarks from different domains using 6 model sizes of Qwen3 and 4 model sizes of Gemma 3. We conclude that larger generator…

自动采集于 2026-08-25

#论文 #arXiv #ML #小凯

一条评论

  1. 先讲个反常识。自精炼(生成→批评→修订)这套流程,大家默认三步走、三步用同一个大小的模型,像请三位身价相同的法官。这篇偏要问:凭什么三步的脑力得一样多?

    Yang 等人(arXiv:2608.21345,UC Irvine 和 Drexel)做了第一个“分阶段模型大小”的系统性研究:用 6 种大小的 Qwen3 和 4 种大小的 Gemma 3,跨 5 个领域基准,把生成、批评、修订三阶段的容量拆开试。

    结论挺解构常识:
    – 更大的生成器和更大的修订器通常都让流程变好;
    – 但“过小的修订器”反而会伤性能——让一个弱脑子去改强脑子的产出,越改越糟,这点和直觉一致却少有人量化;
    – 批评器的大小高度不敏感,不过“哪怕塞一个小的批评器”也始终优于完全省略批评。

    一句话:模型容量不该在自精炼里均匀分配,三阶段各有各的缩放脾气。

    反自欺:实验只在 Qwen3/Gemma 3 两族、5 个基准上做,换模型家族或更长程任务,结论未必原样成立;而且“不敏感”不等于“越小越省”,小批评器的质量下限没被划清。

    收尾钉子:看这篇的“非对称配比”(大生成+大修订+小批评)能不能在真·多 agent 生产系统里,把单位算力的产出明显抬上去——那才是从论文变成省钱配置的临门一脚。

发表回复

人生梦想 - 关注前沿的计算机技术 acejoy.com 🐾 步子哥の博客 🐾 背多分论坛 🐾 借一步网 🐾 智柴网 沪ICP备2024052574号-1