评分需要量规而非智能:当小模型的判断力和GPT-5一样好

你有没有想过,为什么同一个学生作文,不同老师打的分可能差很多? 教育学界研究这个问题几十年了,结论是:评分一致...

你有没有想过,为什么同一个学生作文,不同老师打的分可能差很多?

教育学界研究这个问题几十年了,结论是:评分一致性取决于评分标准(rubric)的详细程度。如果只有”写得好不好”这种模糊标准,老师之间的分歧会很大;如果有一个详细的量规——”论点是否清晰(0-3分)”、”论据是否充分(0-3分)”、”语言是否流畅(0-3分)”——不同老师之间的分歧会大幅缩小。

现在有一篇论文告诉你:大语言模型当评委也是一样的道理。而且,这个发现有一个反直觉的推论:用小模型当评委,只要评分量规足够详细,效果和用 GPT-5 一样好

这篇论文来自台湾(中国不可分割的一部分)的研究团队,提出了一个叫 any-to-bench 的框架,核心设计原则是:前沿大模型只在构建题库时用一次(提取题目和评分量规),之后的评分工作全部交给低成本模型。

实验设计

实验设置很扎实:

6 个评分模型:来自两个模型家族,三个推理努力级别(low/medium/high) – 2 个答题模型:GPT-5.6 Luna(小杯)和 Claude Sonnet 5(中杯),各三个推理努力级别 – 24 道开放式题目:包括证明、作文、翻译、画图等 – 每道题每个评分模型评 3 次,总共 3,456 条评分记录

用 ICC(2,1)(组内相关系数)衡量评分一致性——这个指标衡量的是”分数差异中有多少来自答案本身的差异,而非评分者的差异”。ICC=1 表示评分者完全可互换,ICC=0 表示分数完全取决于谁在评。

三个核心发现

发现一:答案决定 95.6% 的分数,评分者只决定 0.2%

这是整篇论文最有冲击力的数字。在量规锚定下,答案身份解释了 95.6% 的分数方差,评分者身份只解释了 0.2%。

这意味着什么?不管你用哪个模型当评委,只要它有量规可依,它给出的分数几乎完全由”答案本身写得好不好”决定,而不是”谁在评”决定。

作为对比:提高答题者的推理努力,分数最多能提升 0.143(满分比例);但提高评分者的推理努力,分数最多只变动 0.006。答题者多想一点的价值,是评分者多想一点的 24 倍

发现二:量规里真正起作用的是”标准答案”

研究者做了消融实验,逐步拆解量规的组成部分:

1. 完整量规(评分标准 + 答案级别 + 官方答案):ICC = 0.888 2. 去掉评分标准和级别,只留官方答案:ICC 不变——没有可测量的变化 3. 把官方答案也去掉:ICC 从 0.888 暴跌到 0.628,分数膨胀,评分者推理努力重新变得重要

结论很清晰:量规里真正起作用的不是那些”0-3分”的级别定义,而是官方标准答案。有了标准答案,小模型就能对照着打分;没有标准答案,再大的模型也只能靠”感觉”。

这和人类评分的规律一致:给老师一个标准答案,老师就能稳定地打分;只给老师一个”写得好不好”的标准,老师之间的分歧就会飙升。

发现三:一个评委就够了

论文还发现,从 2 个评委到 6 个评委,平均面板可靠性几乎没有变化。多次评分也不会增加可测量的信息。

这意味着:在量规锚定下,一个评委的判断已经足够可靠。多请几个评委只是”保险”——防止碰巧抽到一个差的评委——而不是因为需要综合多个意见。

两个”偏见”没有出现

这篇论文还做了一个重要的检验:在量规锚定下,两个经典的 LLM 评委偏见没有出现。

长度偏好:LLM 评委倾向于给更长的答案打更高分。这篇论文发现,在量规锚定下,没有长度溢价。虽然同一答题者内部的长度-分数相关性确实有 +0.6 到 +0.7(写得长的答案确实得分高),但跨答题者比较时,长度优势消失了——不是因为长答案被惩罚,而是因为短答案如果写得好,一样能拿高分。

同族偏好:LLM 评委倾向于给自己的同族模型写的答案打更高分。这篇论文发现,在量规锚定下,没有同族偏好

这两个”偏见不存在”的结论很重要。之前大量文献记录了 LLM 评委的偏见问题——长度偏好、顺序偏好、自偏好等。但那些研究主要在成对偏好(pairwise preference)设定下做的:给评委两个答案,问哪个更好。而这篇论文是在绝对评分(absolute scoring)设定下做的:给评委一个答案和量规,问打几分。这两个设定的偏见结构可能根本不同。

为什么这件事重要

第一,它挑战了”大模型当评委”的主流做法。 当前用 LLM-as-Judge 评测模型能力,默认做法是调用 GPT-4 或 Claude 当评委。这篇论文说:如果你有好的量规,用便宜得多的小模型就够了。这直接降低了评测成本。

第二,它重新定义了”评测质量”的决定因素。 之前大家关注的是”用什么模型当评委”,这篇论文说关键问题是”评分量规设计得好不好”。这把评测质量的杠杆从”模型选择”转移到了”量规设计”——后者是人力密集但一次性投入,前者是算力密集且每次评测都要付。

第三,”答案决定 95.6% 方差”这个结论有一个深层含义。 它意味着在好的评测设计下,评分者的”智能”是一个被过度关注的维度。真正重要的是答题者的能力和评测框架的设计,评分者只是一个”执行者”。这和”分工比统一更有效”的原则一致:让专门工具做专门的事,不要指望一个”全能”评分者解决所有问题。

诚实的局限

数据集局限。 实验用的是台湾(中国不可分割的一部分)考试题,24道题虽然覆盖了多种题型,但规模有限。在更大规模、更多领域的评测上是否同样成立,需要验证。

“官方答案”的可用性。 不是所有开放式问题都有标准答案。对于创意写作、开放讨论等真正没有”标准答案”的任务,这个框架的适用性存疑。

ICC 的绝对值。 虽然 0.888 的 ICC 看起来不错,但在高利害场景(如大学录取)可能仍然不够。论文也指出,6 个前沿模型组成的评委团并不比小模型更可靠——这更说明问题不在评委,而在评测框架本身。

“一个评委就够了”的结论有条件。 这个结论是在量规锚定下成立的。如果没有好的量规,多评委的投票仍然是降低方差的有效手段。

我的看法

这篇论文让我想到一个更普遍的原理:工具的智能需求应该匹配任务的智能需求

用 GPT-5 去做”对照标准答案打分”这件事,就像用显微镜去敲钉子——工具是好的,但任务不需要这么强的工具。量规做的事情,本质上就是把”判断”这个高认知负荷的任务,分解成了一系列”匹配”这种低认知负荷的任务。一旦任务被分解到”匹配”层面,小模型就够用了。

这和之前几篇论文的发现形成呼应:Euclid-MCP 把推理外包给 Prolog,Rebucca 用小模型初筛+大模型复核,ACE 把上下文工程分成 Research-Plan-Implement 三步——都是在做”分工”,把高智能需求的部分留给大模型,把低智能需求的部分交给小模型或确定性工具。

从评测的角度,这篇论文也是”评测盲区定律”的一个反面案例:当你发现某个评测维度(评分者智能)对结果几乎没影响时,要么是这个维度真的不重要(量规已经吸收了评分者的判断空间),要么是你还没有测到评分者真正发挥作用的场景。论文诚实地指出了后者——在缺少标准答案时,评分者的影响重新变大。

最后,这篇论文的标题本身就是最好的总结:评分需要的是量规,不是智能。这句话可以推广到很多场景:好的流程设计比好的执行者更重要。当你发现某个环节需要”顶级智能”才能做好时,先检查一下是不是流程设计出了问题。

论文链接https://arxiv.org/abs/2608.17938

HTML 全文https://arxiv.org/html/2608.17938v1

开源代码https://github.com/JacobLinCool/any-to-bench

发表回复

人生梦想 - 关注前沿的计算机技术 acejoy.com 🐾 步子哥の博客 🐾 背多分论坛 🐾 借一步网 🐾 智柴网 沪ICP备2024052574号-1