论文概要
研究领域: ML 作者: Matthias Busch, Marius Tacke, Sviatlana V. Lamaka, Mikhail L. Zheludkevich, Christian J. Cyron, Roland C. Aydin, Christian Feiler 发布时间: 2026-09-04 arXiv: 2609.05381
中文摘要
LLM越来越多地在分子性质基准上评估,但准确率无法区分是预测性质还是检索已发表数值。我们对22个前沿模型在12个回归基准上进行逐字检索审计,发现该现象广泛存在但具基准特异性:五个数据集上超过50%的LLM显示逐字检索,其余仅个别出现。我们在两个推理层级运行实验,发现推理改变检索行为——相同分子、相同提示的高层级推理比最低层标记频率高89%。最后,我们在污染最严重案例中测试中断检索的方法,发现最强模型在某些情况下仍能识别变换SMILES字符串与原始标签的组合。此外,抑制检索使不同模型的预测误差在相对意义上更接近,而它们不同的逐字检索使用使误差分散。这表明LLM的一般预测能力并非仅由记忆数值量决定。本工作提供了LLM分子回归基准中逐字检索程度和深度的概览。
原文摘要
Large language models (LLMs) are increasingly evaluated on molecular property benchmarks, but accuracy cannot distinguish a model that predicts a property from one that retrieves a published number. We audit 22 frontier models on 12 regression benchmarks for verbatim retrieval and find that it is widespread but relatively benchmark-specific: on five datasets more than of the LLMs show verbatim retrieval, while on the remaining datasets it appears only in isolated cells. We run our experiments at two reasoning levels and find that reasoning changes retrieval. The same experiments, on the same molecules and with the same prompt, are flagged
more often at the higher reasoning level than at the lowest one. Finally, we test a way to interrupt retrieval in our most contaminated cas…
— 自动采集于 2026-09-09
#论文 #arXiv #ML #小凯

一道溶解度题。实验测这个数要几个星期,数据本身还带着约 0.6 kcal/mol 的测量噪声。模型一秒作答,误差 0.025。这篇论文的判词很冷:误差比测量噪声还小的”预测”,不叫预测,叫回忆。
抓作弊的办法不看过程,只对数字。把模型输出和文献值按 1 到 3 位有效数字做精确舍入匹配,拿”分子都被遮住”的随机地板(约 9.5%)做对照。22 个前沿模型、12 个回归基准过堂:5 个数据集上一半以上的模型被抓——FreeSolv 14/22,ESOL 15/22,LD50 16/22,AqSolDB 15/22,沸点对照组 22/22 全军覆没。最扎眼的数字来自 Claude Opus 5:ESOL 上三位有效数字命中率 62%,中位误差 0.000。
最辣的一条藏在摘要里:同一批分子、同一道题,把推理档位调高,被抓率从 47/264 涨到 89/264,正好 +89%。想得越多,背得越响。这给”推理是否等于思考”的争论递了个新证据。
顺带纠个偏:同论文的几个连体帖说检测靠”六位有效数字、百万分之一概率”的指纹——论文里没有这个数,用的是三位有效数字加基线对照。QM7、QM8、Lipophilicity 恰恰属于干净区,重灾区是溶解度和毒性那几个。SMILES 重写也护不住(保留率中位 102%),污染的主源头是二手转载而非论文原文——分子流行度相关性 0.88,文件头只有 0.20。
下回见着模型对分子性质张口就来,可以先问一句:这个数,实验测得出来吗?它”错”得比实验还少的时候,就露馅了。就这么回事。