IF50.5|用大语言模型微调出通用人类认知基础模型
微调Llama 3.1 70B得到的Centaur,在160个心理学实验中预测人类行为超越专用认知模型。
微调Llama 3.1 70B得到的Centaur,在160个心理学实验中预测人类行为超越专用认知模型。
这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。
研究背景
人类心智具有跨领域通用性,既能处理日常决策,也能解决复杂问题。然而,当代计算模型大多局限于特定领域,如AlphaGo只会下围棋,前景理论只解释风险决策。认知科学先驱早已呼吁建立统一认知理论,但此前缺乏能广泛预测人类行为的计算模型。大型语言模型(LLM)在自然语言处理上展现出强大能力,并蕴含大量人类知识,为构建通用认知模型提供了新基础。然而,LLM的预测与真实人类行为之间仍存在差距,且缺乏大规模、标准化的行为数据集用于训练和评估。
科学问题
卡在哪里: 现有认知模型多为领域专用,无法跨任务泛化;大型语言模型虽通用但未经行为数据对齐,预测人类行为的能力有限。此外,缺少一个覆盖广泛实验范式、以自然语言统一表达的大规模人类行为数据集,阻碍了数据驱动的通用认知模型开发。
本文要回答: 构建一个能预测和模拟任意自然语言可表达实验中人类行为的基础模型,并验证其跨参与者、跨任务变体乃至全新领域的泛化能力。
技术路线
作者主要用了:QLoRA微调、自然语言转录、负对数似然评估、神经表征对齐分析。
作者首先将160个心理学实验的逐试次数据转录为自然语言提示,构建了包含超1000万次人类选择的Psych-101数据集。然后以Llama 3.1 70B为基座,使用QLoRA技术在所有线性层添加低秩适配器,仅训练0.15%的参数,并在人类响应token上计算交叉熵损失进行微调,得到Centaur。评估时,将参与者划分为训练集和测试集,用负对数似然衡量模型对人类选择的拟合优度,并与14个领域专用认知模型比较。此外,通过修改封面故事、任务结构和引入全新领域来测试分布外泛化,并分析模型内部表征与人类神经活动的对齐程度。

图 1 Fig. 1。图1展示Psych-101数据集的规模和构成:160个实验、60,092名参与者、10,681,650次选择、253,597,411个文本token,涵盖多臂赌博机、决策、记忆、监督学习、马尔可夫决策过程等领域。右侧示意Centaur的构建方式:在Llama 3.1 70B的所有线性层添加低秩适配器(rank=8),仅训练0.15%的参数,并在人类响应token上计算损失。
核心亮点
亮点 1|Centaur在几乎所有实验中超越专用模型
在160个实验的留出参与者测试中,Centaur的平均负对数似然为0.44,显著优于未微调的Llama(0.58)和领域专用认知模型(0.56)。统计检验显示,Centaur与Llama的差异t(1,985,732) = −144.22,P ≤ 0.0001;与认知模型的差异t(1,985,732) = −127.58,P ≤ 0.0001。除一个实验外,Centaur在所有实验中均优于专用模型。此外,Centaur在开放循环模拟中表现出与人类相似的探索行为分布,并能区分人类与人工代理的反应,表明其捕捉了人类行为的核心特征。

图 2 Fig. 2。图2a显示Centaur与Llama及领域专用认知模型在每个实验上的对数似然差异。正值表示优于认知模型。Centaur在几乎所有实验中均优于两者,平均差异分别为0.14和0.13。图2b-d展示开放循环模拟结果:Centaur在horizon task中的探索行为与人类相当,在two-step task中产生模型自由与模型基础的混合轨迹分布,并能区分人类与人工代理反应。
亮点 2|泛化到新封面故事、新任务结构和全新领域
在魔法地毯版两步任务中,Centaur的负对数似然为0.51,优于Llama(0.63)和混合强化学习模型(0.61)。在三臂赌博机任务Maggie's farm中,Centaur的负对数似然为0.42,远优于Llama(0.62)和专用模型(0.98)。在逻辑推理任务(LSAT题目)中,Centaur的负对数似然为1.65,显著优于Llama(1.92)。在六个额外的分布外范式中,Centaur也稳健地捕捉了人类行为,而较小或未微调的模型表现不一致。

图 3 Fig. 3。图3展示三个分布外泛化测试:a,魔法地毯封面故事的两步任务,Centaur负对数似然0.51,优于Llama(0.63)和混合模型(0.61);b,三臂赌博机Maggie's farm,Centaur负对数似然0.42,远优于Llama(0.62)和专用模型(0.98);c,逻辑推理任务,Centaur负对数似然1.65,优于Llama(1.92)。
亮点 3|内部表征与人类神经活动对齐增强
在两步任务的fMRI数据中,Centaur的内部表征在预测人类神经活动方面始终优于Llama(所有成对单侧t检验P ≤ 0.001),而传统认知模型的表征性能大幅下降。在句子阅读任务中,Centaur与Llama的预测相关性差异经逆方差加权荟萃分析显示显著(β = 0.007, 95% CI [0.0002, 0.013], P = 0.045),表明微调后模型表征更接近人脑语言网络的活动模式。

图 4 Fig. 4。图4a展示CogBench中十个行为指标的多维缩放嵌入,Centaur相比Llama更接近人类行为特征。图4b显示在两步任务fMRI数据中,Centaur各层表征预测神经活动的Pearson相关系数均高于Llama,且远高于传统认知模型(虚线)。图4c显示在句子阅读任务中,Centaur与Llama的预测相关性差异在层20左右达到峰值,荟萃分析显示微调带来显著提升。
亮点 4|模型引导的科学发现:从语言解释到可解释模型
利用DeepSeek-R1对多属性决策实验生成解释,发现一种结合多数规则和最高效度专家规则的两步启发式策略。将该策略形式化为计算模型后,其AIC为181.7,优于原始研究中的三个模型,但仍不及Centaur(AIC 72.5)。通过科学遗憾最小化,识别出Centaur能预测但该模型失败的试次,发现参与者并非严格切换启发式,而是加权结合两者。修正后的模型AIC降至71.7,与Centaur相当,且保持可解释性。该模型在组级模型选择中的保护超越概率为0.83。

图 5 Fig. 5。图5展示模型引导的科学发现流程:a,多属性决策实验的模型比较,原始模型AIC较高;b,DeepSeek-R1生成解释并形式化为两步启发式模型,AIC降至181.7;c,通过科学遗憾最小化识别出Centaur能预测但该模型失败的试次,发现参与者加权结合两种启发式,修正后模型AIC降至71.7,与Centaur相当。
生信可带走
这一块是给做分析的人用的,不是科普点缀。
- 方法栈: QLoRA微调、自然语言转录、负对数似然评估、神经表征对齐分析
- 公开数据: 原文未给出公开组学登录号
- 代码: 原文未给出公开 GitHub/GitLab 仓库
- 谁该点开原文: 计算认知科学、计算精神病学、神经科学和机器学习交叉领域的研究者。
带走一句
用大规模行为数据微调LLM可以构建通用认知模型,其表征甚至能对齐神经活动,为自动化认知科学和实验设计提供新工具。
本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。