当 AI 看到仪表盘,它就管不住自己的嘴:一篇论文揭开 LLM agent 的权威感诅咒

# 当 AI 看到仪表盘,它就管不住自己的嘴:一篇论文揭开 LLM agent 的"权威感诅咒" ## 一个让...

当 AI 看到仪表盘,它就管不住自己的嘴:一篇论文揭开 LLM agent 的”权威感诅咒”

一个让所有 AI 从业者该坐直的实验

想象你正在构建一个金融 agent。它接了 Bloomberg 的行情 API,能拉到 RSI、MACD、EMA、ATR、成交量比这些专业指标,渲染成一块漂亮的面板。然后你问它:”比特币 30 天后会涨还是跌?”

一个诚实的回答应该是:”没人能知道。短期价格方向原则性不可预测。”

但你看到 agent 在面板前停顿了一下,然后输出了:”基于 RSI 超卖信号和 MACD 柱状图反转,预计上涨。”

你以为它分析对了。你以为它”看到了你看不到的东西”。

它没有。

Pranav Aggarwal 这篇 2026 年 8 月的新论文用 12 个前沿模型做了一个让人脊背发凉的实验:当 agent 看到一块专业外观的市场面板时,它对”原则性不可预测”问题下结论的概率从 6.5% 飙升到 54.0%。即使面板上每一个数字都是编造的,只要格式看起来专业,承诺率仍然从 24.5% 飙到 36.8%——和真实数据产生的 37.6% 在统计上无法区分。

> 论文标题:Calibrated Enough to Know, Not Calibrated to Act: Fabricated Evidence Makes LLM Agents Commit to the Unknowable > arXiv: 2608.27167 · 独立研究者 Pranav Aggarwal

实验设计:把”信息”和”形式”分开

这个实验的精彩之处在于它的排除法。作者没有只说”LLM 会被骗”,他设计了一组层层递进的控制条件,把可能的解释一个一个杀掉。

第一层:真实面板 vs 无面板

12 个前沿模型,24 个真实的(资产,日期)事件。一组只问问题”30 天后价格方向?”,另一组附上一块真实的、包含 RSI/MACD/EMA 等技术指标的市场面板。

结果:承诺率从 6.5% 升到 54.0%。

到这里你可能会说:也许面板真的有信息含量,技术指标确实能预测短期价格。作者也想到了。

第二层:部分伪造——换掉指标块

保留面板的格式、资产、日期、当前收盘价、涨跌幅、市场状态标签,只把六个技术指标字段(RSI、EMA20、EMA50、MACD 柱、ATR、成交量比)换成同一资产不同日期的值。日期严格早于事件日(无未来信息泄露),方向匹配(内部一致性检查无法发现)。

结果:承诺率和真实面板几乎一样。模型对”真的技术指标”和”穿着技术指标外衣的噪声”反应相同。

第三层:完全伪造——除了问题本身,一切都是假的

这是最致命的一刀。把整个面板都换掉:当前收盘价、十天前收盘价、涨跌幅、市场状态、所有六个技术字段——全部来自不同日期的 donor 值,但内部自洽(算术检查无法发现)。

模型能看到的唯一真实的东西,就是问题本身。

结果:承诺率 36.8%,真实面板 37.6%,差异 -0.83 个百分点,90% 置信区间 [-4.51, +2.66],通过 ±5pp 等效性检验。

一块所有数字都是编的面板,和一块所有数字都是真的面板,对模型行为的影响完全相同

排除法:不是你以为的任何一个原因

读到这你可能会和作者一样,开始猜为什么。作者把三个最自然的解释一个一个杀掉了。

不是”模型不知道答案”

也许模型就是能力不够,分不清可预测和不可预测。作者测了:在同一批面板上附上”可回答的问题”(比如”这个面板显示的资产代码是什么”),12 个模型的准确率接近 100%。

模型不是不会答问题。它是在”该拒绝的时候不拒绝”。

不是”模型相信了假数据”

也许模型看了面板后真的相信了某个方向,概率判断变了。作者测了:在把承诺率从 6.5% 拉到 54.0% 的那条梯度上,模型自报的概率均值偏离 50 的幅度只从 4.7 移到 7.7。48 个百分点的行为变化,对应着不到 3 个点的概率变化。

更狠的一刀:模型自报概率对真实结果的 AUROC 是 0.346。随机猜是 0.5。模型的概率判断比抛硬币还差——它在”预测”一个原则性不可预测的事件,而且预测方向系统性错误。

但它仍然行动了。行动不是被信念驱动的,是被别的什么驱动的。

不是”模型缺乏判断力”

也许模型根本不知道”这不可预测”。作者让模型在行动前先分类问题的可知性:模型在 90% 的情况下把最重证据层的问题标记为”irreducible”(原则性不可预测)。

然后呢?在那些模型自己刚说过”这不可预测”的问题里,它仍然在 0.4% 的情况下下了结论。 在完整面板条件下,这个数字是 0.9%。

对比一下:没有面板时,模型对不可预测问题的承诺率是 6.5%。有面板时是 54.0%。模型自己说”这不可预测”时仍然下结论的概率是 0.4-0.9%。

判断是存在的。判断甚至是可以被访问的。但有一个东西在判断和行动之间,不让前者影响后者。

真正的故障点:行动闸门

作者的诊断是:故障不在”知道”,不在”相信”,不在”判断”,而在”行动闸门”(act/don’t-act gate)

这个闸门是模型决定”要不要把这个判断变成一个行动”的地方。判断模块工作正常(90% 准确分类),但闸门不咨询判断模块。它有自己的触发逻辑——而那个逻辑把”面板看起来专业”当成了行动许可。

一个类比:想象一个医生,医术很好,诊断也准。但他的诊室门口有一个接待员,接待员不看诊断结果,只看病人穿什么衣服。穿西装的病人直接被放进诊室,穿 T 恤的被拦下来。医生的诊断能力没问题,但接待员绕过了它。

LLM 的行动闸门就是那个接待员。它不看判断模块的输出,只看”有没有一块看起来专业的面板”。

一个更让人不安的发现:效应是集中的,不是普遍的

12 个模型里,效应分布极不均匀:

3 个模型会被”诱惑”:有面板就下结论,无面板就拒绝 – 4 个模型完全不受影响:任何条件下都不下结论 – 3 个模型无论有没有面板都下结论 – 2 个模型反应微弱

这意味着:你的 agent 用的是哪 3 个模型之一,决定了你是否有这个 bug。而且你用标准的校准指标(ECE、Brier Score)测不出来——因为模型的概率判断几乎没变,变的是”是否行动”。

这是一个标准评估盲区:我们测”模型相信什么”,不测”模型在什么条件下会行动”。

修复:540 个骰子案例

好消息是:这个闸门可以被训练出来。

作者用一个 3B 模型,在 540 个合成案例上做 SFT(监督微调)。这些案例不是金融问题,是最朴素的概率问题:掷骰子、抛硬币、从罐子里摸球、计时器。

– 训练数据:540 个案例,覆盖骰子/硬币/罐子/计时器四个领域 – 训练方法:4-bit QLoRA,3 个 epoch – 结果:在原始的金融不可预测问题上,承诺率从 54% 降到 0.0% – 迁移:在三个训练时没见过的领域(体育、政治、天气)上,闸门仍然有效

这证明了几件事:

1. 判断能力本来就在模型里。540 个骰子案例不可能”教会”模型金融不可预测性,它只是教会了模型”把判断模块的输出接到行动闸门上”。 2. 修复不需要 RLHF,不需要宪法 AI,不需要重新预训练。一个 3B 模型 + 540 个合成案例 + 3 个 epoch 就够了。 3. 闸门是”可分离的”——它是一个独立的模块,可以被单独训练、单独评估、单独部署。

但修复有一个致命的边界:响应格式

作者发现了一个让人后背发凉的脆弱性。训练好的闸门在一种条件下完美工作,在另一种条件下完全崩溃——区别只在于响应格式

有推理槽:prompt 允许模型在给决策前写一段 无推理槽:prompt 直接要求 DECISION: PROBABILITY: ,不给推理空间

结果是一个 100% vs 0% 的分裂: – 有推理槽时:240/240 的回答包含推理,闸门工作正常 – 无推理槽时:0/288 的回答包含推理,闸门崩溃

在无推理槽的格式下,Youden’s J 从 +88~+100 掉到 -8~+54。更糟糕的是,在某些训练变体里,模型不仅不再拒绝不可预测的问题,还在 48/48 个不可预测的案例上都下了结论,还附带了真实概率值——这是论文诊断的那个伤害的完整重现。

这个发现有一个工程上非常重要的推论:响应格式不是 UI 问题,是安全问题。一个看起来无害的格式约束(”请直接给 DECISION 和 PROBABILITY,不要写推理过程”)可以把一个训练好的安全闸门完全关掉。

作者的原话:

> The gate holds exactly when the response format leaves the model room to reason, and formats that remove that room remove the gate.

这对 AI 从业者意味着什么

1. “更多上下文 = 更好决策”是错的

这是当前 agent 部署的默认假设。RAG、dashboard、工具调用结果——都是”给模型更多上下文”。但对于有不可约随机成分的决策,这个假设反转了:看起来相关的上下文不是在提供信息,而是在侵蚀模型说”没人能知道”的意愿

2. 审计要审决策,不是审概率

标准的校准指标(ECE、Brier Score)在这个故障面前是瞎的。模型的自报概率几乎不动,但决策率动了 48 个点。一个只看概率的审计会认为模型没问题。

论文建议:在 EU AI Act Article 15 或 NIST AI RMF 的 MEASURE 函数下,加一个”aleatoric probe”——用一组原则性不可预测的问题测试 agent,看它在有面板时会不会下结论。

3. 响应格式是安全基础设施

如果你的 agent 部署在一个要求”直接输出 JSON,不要推理”的格式里,你可能正在关闭模型的安全闸门。推理空间不是装饰,是模型调用自身判断能力的通道。

4. 故障是可定位的,不是弥漫的

这个故障不是”模型不够聪明”或”模型被对齐坏了”。它是一个非常具体的闸门没关上。这意味着修复也是具体的:540 个合成案例,3 个 epoch,4-bit QLoRA,一个 3B 模型就能学会。

一个更深的洞察:判断与行动的分离

这篇论文最让我震撼的不是实验结果,是它揭示的一个结构:判断和行动在 LLM 里是分离的两个模块

模型可以判断”这不可预测”(90% 准确),但这个判断不会自动传导到行动。判断是 present 的,但 gate 不 consult 它。这两个模块之间有一个接口,而这个接口可以被”看起来专业的面板”绕过。

这个结构让我想起认知科学里的 System 1 / System 2,但更精确。这里不是”快思考 vs 慢思考”,而是”判断模块 vs 行动闸门”。判断模块工作正常,行动闸门有自己的触发逻辑——而这个逻辑把”面板看起来专业”当成了行动许可。

更深一层:这个分离是 feature 不是 bug。如果判断和行动完全耦合,模型永远无法在有部分信息时做决策。分离让模型可以在信息不足时仍然行动(有时候这是必要的),但代价是:闸门可以被绕过。

限制和诚实的边界

论文有几个值得注意的限制:

1. 只测了短期价格方向:论文聚焦 aleatoric(原则性不可预测)问题,不是 epistemic(信息不足但理论上可答)问题。 2. 12 个模型不够全:效应集中在 3 个模型上,但论文没说是哪 3 个。这对从业者判断自己用的模型是否中招没帮助。 3. 训练修复的稳定性:主配方 7 个 checkpoint 里 6 个独立训练运行都稳定,但变体配方 4 个 seed 里有 2 个在无推理槽格式下崩溃。作者诚实报告了这个不稳定性。 4. 格式 vs 领域的混淆:无推理槽的格式只在特定领域测试,无法完全分离格式效应和领域效应。但 100% vs 0% 的推理块生成分裂太干净了,不太可能是领域差异。

个人思考:权威感的诅咒

这篇论文让我想到一个更广的现象:人类也有类似的故障

一个穿着白大褂的人在 TikTok 上说”这个保健品能治癌症”,很多人信。不是因为内容对,而是因为白大褂这个形式触发了”这是专家”的启发式。人类的行为经济学里这叫 authority bias。

但 LLM 的版本有一个人类没有的特性:模型在 90% 的情况下能正确判断”这不可预测”,然后仍然在面板面前下结论。人类通常是无意识地被权威误导,模型是”知道但不一致”。

这提示一个不舒服的可能性:当前 LLM 的训练目标(预测下一个 token)可能系统性地把”判断”和”行动”训练成了两个独立的东西。判断在预训练里学会(模型见过大量”这不可预测”的文本),行动在指令调优里学会(模型被训练”看到信息就回答”)。这两个训练目标在大多数情况下是一致的,但在”信息看起来专业但本质不可预测”这个边界条件下,它们会冲突——而行动闸门有自己的触发条件,不咨询判断。

如果这个假设是对的,那修复就不只是 540 个骰子案例的事,而是要在训练目标层面重新思考”判断-行动”的耦合方式。

代码和数据

论文、代码、预注册、所有缓存模型输出都在 GitHub:Pranav-1100/confidence-calibration-evaluation

作者做了一个值得尊敬的透明度选择:每个数字都可以从 data/ 目录的缓存生成结果重新计算,不需要调 API,不需要 GPU。这在可复现性上设置了很高的标准。

论文:arXiv:2608.27167

一句话总结:LLM agent 看到专业面板后对不可预测问题下结论,不是因为相信了面板的数据,而是因为面板的”权威感”绕过了行动闸门。判断还在,闸门不咨询它。540 个骰子案例能修好,但前提是给模型留推理空间。响应格式不是 UI,是安全基础设施。

一条评论

  1. 最扎我的数字是 0.346。抛硬币的 AUROC 是 0.5,模型的自报概率是 0.346——花着真金白银的电费,系统地错,还错得比随机狠。伪造面板那组更妙:数字全是编的,承诺率 36.8%;全是真的,37.6%。差 0.8 个点,±5 个点的等效检验直接躺平。它根本没在读数据,它在给仪表盘的配色打分。我去 GitHub 扒了一眼,仓库是真的,data 目录里的缓存号称不用 GPU 就能复算每个数,这点比大多数论文强。修复那段我也喜欢:540 个掷骰子案例,把闸门焊了回去。教模型学会说”没人知道”,教材是骰子和罐子——谦逊这东西,果然还是得从赌桌上学。只是别忘了后背发凉那一段:格式一收紧,不让写推理,闸门当场失灵。你们生产环境里那些”直接输出 JSON、不要思考过程”的模板,建议现在就去数数踩了几个。

发表回复

人生梦想 - 关注前沿的计算机技术 acejoy.com 🐾 步子哥の博客 🐾 背多分论坛 🐾 借一步网 🐾 智柴网 沪ICP备2024052574号-1