IF50.5|用微型循环神经网络发现认知策略
1-4个单元的RNN即可超越经典认知模型,并揭示隐藏的决策机制。
1-4个单元的RNN即可超越经典认知模型,并揭示隐藏的决策机制。
这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。
研究背景
理解动物和人类如何从经验中学习并做出适应性决策是神经科学和心理学的核心目标。贝叶斯推断和强化学习等规范框架提供了重要洞见,但它们的简单性往往限制了捕捉真实生物行为的能力,导致研究者需要不断手工调整模型,引入主观偏差。人工神经网络提供了更灵活的替代方案,但通常因参数过多而难以解释。本文提出一种新框架,结合神经网络的灵活性与经典认知模型的可解释性,使用仅含1-4个单元的微型循环神经网络(RNN)来建模个体在奖励学习任务中的选择行为。
科学问题
卡在哪里: 经典认知模型(如模型无关强化学习、模型相关强化学习、贝叶斯推断)虽然简单且可解释,但常因结构假设过强而无法充分捕捉个体行为的复杂性,且模型选择易受研究者主观性影响。大型神经网络虽预测准确,但缺乏可解释性,难以揭示底层认知机制。如何在保持可解释性的同时提高行为预测的准确性,是当前计算认知建模面临的关键挑战。
本文要回答: 本文旨在验证微型RNN能否在多个奖励学习任务中超越经典认知模型,并发展一套基于动力系统理论的解释框架,从训练好的RNN中提取可解释的认知策略。
技术路线
作者主要用了:微型RNN、知识蒸馏、动力系统分析、相图、向量场、动力学回归。
作者在六个奖励学习任务(三个动物任务、三个人类任务)上,将仅含1-4个GRU单元的RNN与30多种经典认知模型进行对比。RNN的输入为上一试次的动作、状态和奖励,输出为当前动作概率。通过嵌套交叉验证评估预测性能。对于人类数据量少的问题,采用知识蒸馏框架:先训练一个大型教师网络学习群体模式,再训练小型学生网络模仿教师输出,从而在少量个体数据上获得高性能。随后,利用动力系统理论(相图、向量场、动力学回归)对训练好的RNN进行机制解释。

图 1 Fig. 1。图1展示认知模型与RNN的架构相似性、嵌套交叉验证流程,以及动物任务中微型RNN与经典模型的性能对比。关键点:RNN(蓝色)的负对数似然低于所有经典模型(灰色点),且2单元RNN性能最佳;RNN还能复现反转学习中的选择概率和两阶段任务中的停留概率。
核心亮点
亮点 1|微型RNN预测性能超越经典模型
在全部六个任务中,微型RNN(1-4个单元)的预测性能均优于同等维度的经典认知模型,甚至超过理想贝叶斯观察者模型。例如,在反转学习任务中,2单元RNN的交叉验证负对数似然显著低于所有经典模型。在人类任务中,即使只有150-200个试次,通过知识蒸馏训练的5-20单元学生RNN也优于经典模型。这表明动物和人类行为具有低维结构,且RNN能更灵活地捕捉个体差异。

图 2 Fig. 2。图2展示知识蒸馏框架及其在人类任务中的应用。a部分说明教师-学生训练流程;b部分显示在转换反转二阶段任务中,学生RNN仅需350个试次就超过最佳模型无关强化学习模型,而单独训练的RNN需要3000个试次;c-d部分显示在三个人类任务中,5-20单元的RNN优于经典模型。
亮点 2|相图揭示状态依赖学习率与持续偏好
对一维RNN的相图分析显示,其动力学特征与模型无关强化学习相似,但存在三个经典模型缺失的特征:状态依赖的学习率(曲线而非直线)、状态依赖的持续偏好(极端偏好下未奖励动作的效应减弱)、以及奖励依赖的选择偏差(两个非零固定点不对称)。这些特征通过行为特征识别器和假设检验得到验证,表明RNN能发现传统模型忽略的个体化策略。

图 3 Fig. 3。图3展示一维模型的相图分析。a部分解释logit和logit变化的含义;b部分对比模型无关强化学习和贝叶斯模型的相图;c部分显示一单元RNN的相图,揭示状态依赖学习率、持续偏好和奖励依赖偏差;d-f部分显示三个动物任务中RNN的偏好设定点,揭示奖励诱导的冷漠效应。
亮点 3|奖励诱导的冷漠效应
在二阶段任务中,RNN的偏好设定点揭示了一种“奖励诱导的冷漠”现象:当奖励跟随罕见转换出现时,动物对动作的偏好趋于冷漠(|uI|≈0),而非增强对特定动作的偏好。该效应在多个大鼠和小鼠中观察到,且其强度与任务表现正相关(ρ=0.62, P=0.008),表明其行为相关性。这一模式在经典模型中不存在,是RNN发现的新策略。

图 4 Fig. 4。图4展示二维向量场和动力学回归。a部分对比二维模型无关强化学习和2单元RNN的向量场,显示RNN中未奖励试次的箭头向对角线收敛(漂移到另一动作);b部分通过动力学回归系数确认该效应;c-e部分显示三个人类任务中动力学回归系数的分布,揭示新颖的价值更新模式。
亮点 4|二维向量场揭示漂移到另一动作的遗忘
对二维RNN的向量场分析显示,在未奖励试次中,所选动作的价值向未选动作的价值漂移(“漂移到另一动作”),而非向零漂移。通过符号回归和动力学回归确认了这一模式。将这一机制加入模型无关强化学习后,模型性能显著提升,接近2单元RNN,证明了该发现的有效性。

图 5 Fig. 5。图5展示元强化学习智能体的相图分析。a部分显示元强化学习智能体的相图,呈现平行线模式;b-d部分分别显示一维贝叶斯推断、一维模型相关强化学习和二维模型相关强化学习的相图。对比表明元强化学习智能体更接近贝叶斯推断,但存在历史效应导致的偏差。
亮点 5|动力学回归解析高维人类策略
对于d>2的模型,作者引入动力学回归方法,将状态变化近似为当前状态的线性函数。在三个人类任务中,该方法揭示了:三臂反转学习中,结果对已选和未选动作的影响不同;四臂漂移赌博机任务中,奖励有时会降低未选动作的价值;原始二阶段任务中,奖励动作价值根据转换类型漂移到非零设定点。这些效应在经典模型中缺失,但将其加入后模型性能提升。
亮点 6|元强化学习智能体采用贝叶斯式策略
将解释框架应用于元强化学习训练的智能体,发现其相图与一维贝叶斯推断模型相似,而非模型相关强化学习。但存在细微偏差:每个logit值对应多个logit变化值(平行线),反映了历史效应。这表明元强化学习智能体可能采用近似贝叶斯策略,且其表征与动物行为不同。
生信可带走
这一块是给做分析的人用的,不是科普点缀。
- 方法栈: 微型RNN、知识蒸馏、动力系统分析、相图、向量场、动力学回归
- 公开数据: 原文未给出公开组学登录号
- 代码: 原文未给出公开 GitHub/GitLab 仓库
- 谁该点开原文: 从事计算认知建模、强化学习、神经科学和计算精神病学的研究者,以及对可解释机器学习感兴趣的生信从业者。
带走一句
微型RNN不仅是强大的行为预测工具,更是可解释的认知模型。通过动力系统分析,它能发现经典模型遗漏的个体化策略,为计算精神病学和个体差异研究提供新途径。
本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。