论文概要
研究领域: ML 作者: Anagha Gokul, Jason Hartline, Lunjia Hu, Jonathan Ullman, Yifan Wu 发布时间: 2026-08-21 arXiv: 2608.21348
中文摘要
校准要求概率报告在条件上无偏,并可靠地解释为概率。校准度量将数值误差分配给未校准的报告。Haghtalab等人(2024)提出了一种近似真实的在线预测校准度量,留下精确真实性是否与完备性和可靠性相容的开放问题。我们对顺序二元预测否定地回答了这个问题:精确真实性与完备性和可靠性不相容,即使对于独立结果也是如此。然后我们证明这一不可能性特定于精确真实性。我们给出两种从基础校准度量产生加性和乘性近似真实校准度量的一般归约。应用乘性归约,对于每个0 < ε < 1,我们构造了一个可靠且完备的校准度量,它是(1+exp(-T^(1-ε)/2/2))-乘性真实的。这改进了Haghtalab等人(2024)的近似真实性保证。
原文摘要
Calibration requires probabilistic reports to be conditionally unbiased and reliably interpretable as probabilities. A calibration measure assigns numerical error to miscalibrated reports. Haghtalab et al. (2024) proposed an approximately truthful calibration measure for online prediction, leaving open whether exact truthfulness is compatible with completeness and soundness. We resolve this question negatively for sequential binary prediction: exact truthfulness is incompatible with completeness and soundness, even for independent outcomes. We then show that this impossibility is specific to exact truthfulness. We give two general reductions from a base calibration measure, producing additively and multiplicatively approximately truthful calibration measures, respectively. Applying the mul…
— 自动采集于 2026-08-25
#论文 #arXiv #ML #小凯

模型说「我有 70% 把握」,你敢信吗?校准(calibration)问的就是这个:它的概率,到底是不是真概率——凡是它说 70% 的事,是不是真有七成发生?
这篇论文给的结论有点扫兴。Haghtalab 等人 2024 提了个「近似真实」的在线校准度量,留下个悬案:精确的「真实性」能不能和「完备性」「可靠性」同时成立?本文对顺序二元预测给了否定答案——连独立结果都不行,精确真实性就是和那两条不相容。
可别急着绝望。作者发现,这个「不可能」是精确真实性独有的。他们给出两种从基础校准度量出发的归约:加性近似真实的、和乘性近似真实的。用乘性那个,对每个 0<ε<1,都能构造出既可靠又完备、且 (1+exp(-T^(1-ε)/2))-乘性真实的度量——比 2024 年的保证更紧。
费曼视角:一个天气员若对自己的不确定性永远「完全诚实」,他要么在撒谎,要么没用。你要的是「足够诚实」,不是「数学上完美诚实」。精确解不存在,近似解够用——这本身就是工程里最体面的退场。
收尾:概率报告若不可信,再漂亮的置信区间都是装饰。这篇把「怎么诚实地给 AI 打分」往前推了一步,用的不是更花哨的模型,是一点不动声色的数学。