周启涛生物技术工作室
其他前沿2026/04/22· 编译自 Nature

IF50.5|准确率评估正在奖励大模型幻觉

用准确率考核大模型,等于逼它不懂装懂。

用准确率考核大模型,等于逼它不懂装懂。

这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。

研究背景

大语言模型(LLM)有时会生成看似合理但实际错误的回答,即“幻觉”,这严重限制了其在可靠性要求高的领域的应用。此前研究已提出多种解释和缓解方法,如检索增强、基于一致性的自验证、基于人类反馈的强化学习等,但即使在最先进的模型中,幻觉问题依然存在。一个典型例子是,当被问及“PGGB代表什么”时,多个主流模型都给出了自信但完全错误的答案,而不是承认不知道。这表明模型在不确定时倾向于猜测而非弃权,类似于学生在难题上蒙答案。理解幻觉为何产生并持续存在,是进一步减少幻觉的关键。

科学问题

卡在哪里: 已有工作多从训练数据或模型架构角度解释幻觉,但忽略了评估环节的激励作用。主流排行榜普遍采用准确率等二元评分指标,将弃权视为错误,从而系统性地奖励猜测。这种评估方式与减少幻觉的目标相悖,但此前缺乏对评估激励如何影响模型行为的系统分析。

本文要回答: 本文旨在阐明预训练和准确率评估如何无意中奖励猜测,并提出通过“开放评分标准”重新对齐评估激励,使模型在不确定时愿意弃权。

技术路线

作者主要用了:计算学习理论、IIV归约、开放评分标准、SimpleQA评测

作者首先用计算学习理论将幻觉问题归约为“是否有效”(IIV)的二分类问题,证明即使训练数据完全正确,预训练目标也会对缺乏重复支持的事实产生不可避免的错误。然后,通过元评估分析主流基准的评分方式,发现大多数采用二元评分,奖励猜测。最后,提出在问题中明确说明评分规则(开放评分标准),并在一组前沿模型上测试其对幻觉缓解方法采纳的影响。

Fig. 1 · 原文图,按文末许可署名使用
Fig. 1 · 原文图,按文末许可署名使用

图 1 Fig. 1。图1展示了幻觉产生的两个阶段:预训练的下一个词预测目标在统计上倾向于幻觉,即使数据无错误;随后,基于准确率的评估在模型选择中奖励自信猜测,进一步强化幻觉。

核心亮点

亮点 1|预训练本身就有幻觉压力

作者将生成错误与IIV分类错误联系起来,证明生成错误率至少是IIV误分类率的两倍。在任意事实模型下,幻觉率下界与训练数据中仅出现一次的事实比例(singleton rate)相关。例如,若20%的生日事实在训练数据中只出现一次,则预训练模型在这些事实上至少会有20%的幻觉率。这解释了为何模型对反复出现的常识(如国家首都)很少出错,而对一次性细节(如生日)容易编造。

Fig. 2 · 原文图,按文末许可署名使用
Fig. 2 · 原文图,按文末许可署名使用

图 2 Fig. 2。图2左侧说明IIV任务:学习区分有效(+)和错误(-)的生成。右侧用三个例子展示错误来源:拼写错误可通过好模型分离(上),计数错误源于模型表示不佳(中),任意事实错误因数据无模式(下)。

亮点 2|准确率指标奖励猜测

对主流基准的元评估显示,绝大多数采用二元评分,弃权得零分,因此猜测是占优策略。例如,在SimpleQA上,o4-mini准确率略高于GPT-5-mini,但错误率超过3/4,而GPT-5-mini因弃权而错误率低得多。准确率指标掩盖了这种差异,导致开发者倾向于选择更爱猜测的模型。

Fig. 3 · 原文图,按文末许可署名使用
Fig. 3 · 原文图,按文末许可署名使用

图 3 Fig. 3。图3显示一致性缓解方法在四个模型上降低了错误率(幻觉率),但也降低了正确率(准确率),构成采纳障碍。在开放评分标准下,该方法在所有惩罚设置下均优于基线,从而消除了这一障碍。

亮点 3|开放评分标准扭转激励

作者提出在问题中明确说明评分规则(如“答对得1分,答错扣1分,弃权得0.5分”),使模型能根据风险调整弃权行为。在SimpleQA上对四个前沿模型的实验表明,在开放评分标准下,一致性缓解方法(两代一致则输出,否则弃权)在所有惩罚设置下都优于基线,而在封闭评分标准下,该方法因降低准确率而不被采纳。

生信可带走

这一块是给做分析的人用的,不是科普点缀。

  • 方法栈: 计算学习理论、IIV归约、开放评分标准、SimpleQA评测
  • 公开数据: 原文未给出公开组学登录号
  • 代码: 原文未给出公开 GitHub/GitLab 仓库
  • 谁该点开原文: 关注LLM可靠性、评估基准设计或模型对齐的生信研究者与开发者。

带走一句

评估指标不只是测量工具,它们会塑造模型行为。做生信模型评估时,应明确评分规则,避免用单一准确率掩盖弃权与错误的不同代价。

本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

微信二维码

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。

添加微信

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。