心脏病筛查模型0.89的准确率可能是数据泄漏的幻觉——10个模型的泄漏分级审计

![auroc_leak_089.svg](https://ipfs.infogaps.net/ipfs/Qm...

!auroc_leak_089.svg

——一篇对 10 个模型做”泄漏分级审计”的硬核方法论论文

> arXiv: 2609.11838 | Raad Bin Tareaf, Murad Al-Rajab, Samia Loucif, Samer Ellaham, Cedric Schmitz | 2026

一个让人怀疑的数字

如果你翻阅近几年的心血管疾病筛查论文,会发现一个反复出现的数字:AUROC ≈ 0.89。基于国家健康调查数据的机器学习模型,几乎都能达到这个水平。看起来机器学习已经”解决”了心脏病筛查问题。

但这篇论文的作者提出了一个尖锐的问题:这个 0.89 到底是模型学到了什么,还是数据里漏了什么?

“数据泄漏”(target leakage)是指训练特征中包含了和目标变量直接相关的信息——比如一个”是否曾被诊断心脏病”的特征,本质上就是把答案塞进了输入。模型不需要”学”,只需要”查”。

实验设计:五层泄漏风险

作者做了一件非常系统的事:他们把 442,067 个受访者的特征按”泄漏风险”分成五层,从高风险到低风险递减。

然后他们在每一层上测试 10 个不同的模型:线性模型、树集成、神经网络、玻璃盒模型(Glass-Box EBM)、表格基础模型(Tabular Foundation Model)。每个模型在每一层都做完整审计——不只是 AUROC,还包括校准、公平性、共形覆盖率、解释忠实度、推理成本。

最后,把训练好的模型(连同阈值)原封不动应用到 430,755 个 2023 年的受访者数据上,看它能不能迁移。

核心发现:删掉两个特征,所有模型归零

移除两个”诊断后”特征后,所有模型的 AUROC 都掉了 0.049-0.051。 这意味着之前那 0.89 的准确率里,有大约 5 个百分点是纯泄漏贡献的。

更惊人的是:移除泄漏特征后,所有 10 个模型挤在了一个 0.0045 宽的窄带里。线性模型、神经网络、玻璃盒模型、表格基础模型——它们的差异几乎消失了。

这个发现直接回答了论文标题里的问题:“报告的准确率是模型类别的功劳还是泄漏的功劳?” 答案是泄漏。

玻璃盒模型:又快又好又透明

在所有模型中,玻璃盒模型(Explainable Boosting Machine, EBM)表现最让人惊喜:

非劣性:在预设的 0.005 边界内,EBM 不劣于任何其他模型,包括最贵的表格基础模型 – 速度:比最强的表格基础模型快 104 倍可解释性:EBM 的形状函数可以直接审计,这意味着公平性修复和不确定性校准是透明的

透明没有额外成本。 这可能是这篇论文对实践者最重要的结论。

公平性:女性被漏检

论文揭示了一个严重的公平性问题:在统一阈值下,模型对女性心肌梗死的检出率是 75.4%,对男性是 89.0%。差了 13.6 个百分点。

但作者没有止步于报告问题。他们通过编辑 EBM 的形状函数,把性别差距缩小到 1.0 个百分点。这种修复之所以可能,正是因为玻璃盒模型的结构是可审计的——你能看到哪个特征在哪个值区间贡献了什么,然后针对性地调整。

黑盒模型做不到这一点。你不知道它为什么对女性漏检,所以你只能重新训练然后祈祷。

共形预测:覆盖率的盲区

论文还测试了边际共形预测(Marginal Conformal Prediction),发现它对不同群体的覆盖率不均匀:男性 0.86,60 岁以上成人 0.82。这意味着对老年人和男性的不确定性估计更可靠,对女性和年轻人更不可靠。

作者用 Mondrian 校准修复了所有群体的覆盖率。同样,这种修复依赖于模型的可审计性。

迁移性:冻结模型在时间上稳定

把 2022 年训练的模型(连同阈值)原封不动应用到 2023 年数据上,AUROC 变化在 0.002 以内。模型在时间上是稳定的。

这个结果说明:一旦移除了泄漏特征,剩下的信号是真实的、可迁移的。模型不是在死记硬背 2022 年的数据分布,而是在学习真正的心血管风险因素。

这意味着什么

这篇论文的结论可以浓缩成一句话:

> “报告的准确率空间是特征集的属性,不是学习器的属性。评估实践,而非模型容量,才是约束瓶颈。”

翻译成大白话:你以为你在比较模型,其实你在比较特征集。 只要你用了同样的泄漏特征,什么模型都能达到 0.89;只要你移除了泄漏特征,什么模型都掉到 0.84。模型类别根本不是关键变量。

和”评测盲区定律”的连接

这篇论文是我近期看到的”评测盲区定律”最干净的例证之一:

标量幻觉:AUROC 是一个标量,但”0.89″这个数字背后的因果结构完全不同——它可能是学习的结果,也可能是泄漏的结果。用标量管理向量问题,是系统性盲区的根源。 – 判断-闸门解耦:模型内部”学到的东西”和”利用泄漏的东西”是分离的。移除泄漏后,模型仍然”学到了东西”,但之前那个 0.89 的判断并不咨询”这个准确率有多少来自学习”。 – omission blindness:传统评估只检查”模型准确率是多少”(presence),不检查”准确率来自哪里”(absence)。这篇论文做的正是后者——把”准确率来源”作为审计目标。

对实践者的启示

1. 审计你的特征。 在庆祝 0.89 之前,先问自己:这些特征在推理时还能拿到吗?有没有”诊断后”特征混进来了? 2. 玻璃盒模型被低估了。 EBM 在速度、准确率、可解释性、公平性修复上全面占优。透明不只是”可解释性”的加分项,是”可修复性”的前提。 3. 模型类别不是关键变量。 别再纠结”用 XGBoost 还是神经网络”了。在表格数据上,特征工程和泄漏审计比模型选择重要 100 倍。 4. 公平性需要可审计性。 你不能修复一个你看不懂的模型。黑盒模型的公平性修复本质上是在黑盒上打补丁,不如直接用可审计的模型。

我的看法

这篇论文做了一件很少论文做的事:它不是在提出一个新模型,而是在审计一整个领域的评估实践。 而且它的审计不是”你们都做错了”的批判,而是”这是五层泄漏风险、十个模型、六个审计维度的系统分析”。

这种”元评估”工作比提出一个新模型更有价值。因为如果你连”0.89 是真的还是假的”都不知道,你在模型架构上做的所有优化都建立在沙子上。

在追求更高准确率之前,先确认你的准确率是真的。

论文链接https://arxiv.org/abs/2609.11838

开源代码:暂未发布(数据来自 CDC BRFSS 2022-2023 公开数据集)

相关概念:Target Leakage, Glass-Box ML, Conformal Prediction, Fairness Auditing

发表回复

人生梦想 - 关注前沿的计算机技术 acejoy.com 🐾 步子哥の博客 🐾 背多分论坛 🐾 借一步网 🐾 智柴网 沪ICP备2024052574号-1