周启涛生物技术工作室
神经科学2025/05/14· 编译自 Nature

IF50.5|纹状体尾部多巴胺编码无价值的动作预测误差

多巴胺不止编码奖励预测误差,还编码动作预测误差,驱动习惯性重复行为。

多巴胺不止编码奖励预测误差,还编码动作预测误差,驱动习惯性重复行为。

这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。

研究背景

动物选择行为表现出两种倾向:追求奖励和重复过去动作。经典理论认为,中脑多巴胺神经元编码奖励预测误差(RPE),作为价值基础学习的教学信号,强化带来奖励的动作。然而,习惯性重复选择可能由基于运动的教学信号更新。理论模型提出,基底节中存在两类多巴胺教学信号:RPE强化奖励驱动动作,动作预测误差(APE)强化重复动作。腹侧被盖区和内侧黑质致密部多巴胺神经元编码RPE,而外侧黑质致密部和黑质外侧部多巴胺神经元投射至纹状体尾部(TS),并对运动有显著反应。但TS多巴胺是否编码APE、是否作为无价值教学信号,此前缺乏实验证据。

科学问题

卡在哪里: 虽然理论预测运动相关多巴胺可能编码APE,但缺乏直接实验证据。TS多巴胺在运动中的确切功能尚不清楚:是触发运动、调节进行中的动作,还是作为教学信号强化状态-动作关联?此外,TS多巴胺信号如何随学习变化、是否受奖励结果或刺激新奇性调节,均未明确。

本文要回答: 验证TS多巴胺是否编码动作预测误差,并作为无价值教学信号强化重复的状态-动作关联,与经典RPE系统协同支持学习。

技术路线

作者主要用了:光纤记录、光遗传学、化学遗传学、计算建模、行为学

作者采用小鼠听觉辨别任务(cloud-of-tones),结合光纤记录测量TS和腹侧纹状体(VS)多巴胺动态,通过药理学失活、慢性损伤、光遗传学操控和计算建模,系统验证TS多巴胺的信号特征和因果作用。先确认TS及其多巴胺输入对任务学习和执行的必要性,再分析多巴胺信号与运动、奖励、刺激的关系,随后检验其是否符合APE的预测(随学习衰减、受动作可预测性调节、与价值无关),最后通过光遗传刺激和模型模拟证明其教学信号功能。

Fig. 1 · 原文图,按文末许可署名使用
Fig. 1 · 原文图,按文末许可署名使用

图 1 Fig. 1。图1展示TS在任务执行和学习中的必要性。a为任务示意图;b显示muscimol注射位点;c显示TS失活损害表现而DMS失活无影响;d-f显示光遗传抑制D1或D2 SPNs对选择产生相反影响;g-j显示TS损伤导致学习缺陷;k-n显示去除TS多巴胺神经元同样损害学习。

核心亮点

亮点 1|TS多巴胺促进听觉辨别学习

双侧TS注射muscimol损害专家小鼠任务表现,而DMS失活无影响。训练前TS损伤或去除TS投射多巴胺神经元均导致学习速率和最终表现下降。d-AP5输注TS在训练期损害学习但不影响已学会行为。单侧光遗传抑制TS中D1或D2 SPNs对选择产生相反且显著影响。这些结果表明TS及其多巴胺输入对学习和执行该任务至关重要。

Fig. 2 · 原文图,按文末许可署名使用
Fig. 2 · 原文图,按文末许可署名使用

图 2 Fig. 2。图2展示TS和VS多巴胺记录方法及信号特征。a为实验示意图;b显示光纤位置和dLight表达;c为记录位点图谱;d显示示例记录;e-g显示VS多巴胺主要对奖励结果反应,TS多巴胺主要对对侧运动反应,且TS对结果反应极小。

亮点 2|TS多巴胺释放与对侧运动相关

光纤记录显示,TS多巴胺反应与从中心端口出发的对侧运动时间锁定,而VS多巴胺主要对奖励结果反应。线性回归模型表明,VS信号主要由结果核解释,TS信号主要由对侧运动核解释。TS多巴胺对声音无反应,在开放场中也与对侧运动相关,且信号幅度随运动幅度和转角增大。这些结果确认TS多巴胺编码运动信息,而非奖励或感觉刺激。

Fig. 3 · 原文图,按文末许可署名使用
Fig. 3 · 原文图,按文末许可署名使用

图 3 Fig. 3。图3展示TS多巴胺信号符合APE预测。a-d显示VS线索反应随学习增大;e-h显示TS运动反应随学习减小;i-m显示TS反应在重复相同声音-动作配对时减小,VS反应增大;n-s显示新异声音触发熟悉动作时TS反应增大,VS反应减小。

亮点 3|TS多巴胺信号符合动作预测误差

随着学习,TS多巴胺对侧运动反应逐渐减小,而VS线索反应增大。TS反应在重复相同声音-动作配对时减小,VS反应增大。当熟悉动作由新异声音触发时,TS多巴胺反应增大,VS反应减小。TS多巴胺不受奖励结果大小或动作预测价值调节。这些模式与APE预测一致,而非RPE、纯运动、新颖性或显著性模型。

Fig. 4 · 原文图,按文末许可署名使用
Fig. 4 · 原文图,按文末许可署名使用

图 4 Fig. 4。图4展示TS多巴胺刺激强化状态-动作关联。a为实验方法;b为刺激协议;c显示刺激诱导对侧偏差;d显示TS刺激有效而VS刺激无效;e-f显示结果期刺激无效应;g-k显示TS多巴胺反应预测后续选择重复;l-m显示TS多巴胺反应与后续轨迹相似度相关。

亮点 4|TS多巴胺强化状态-动作关联

在中心端口单侧光遗传刺激TS多巴胺释放,在感觉证据偏向对侧的试验中诱导显著的对侧选择偏差,且偏差随会话发展,与教学信号作用一致。刺激VS多巴胺在相同时间点无此效应。在自由选择范式中,TS刺激不诱导选择偏差,而VS刺激诱导偏向刺激端口。TS刺激无奖赏或厌恶效应。逻辑回归显示,前次试验TS多巴胺反应越大,当前试验重复相同选择概率越高。TS多巴胺反应大小与后续轨迹相似度正相关。

Fig. 5 · 原文图,按文末许可署名使用
Fig. 5 · 原文图,按文末许可署名使用

图 5 Fig. 5。图5展示双控制器模型及TS在学习中的贡献。a为模型示意图;b显示双控制器学习快于仅价值控制器;c-d显示控制从价值系统转移到无价值系统;e-g显示光遗传抑制TS SPNs在训练后期才影响行为;h显示模型形成频率特异性关联。

亮点 5|双控制器模型解释学习动态

构建包含价值基础控制器(RPE更新)和无价值控制器(APE更新)的基底节模型。仅无价值控制器无法学习任务,仅价值控制器可学习但较慢,双控制器学习最快。模型中价值基础actor权重随时间衰减,导致控制从价值系统转移到无价值系统。实验上,光遗传抑制TS SPNs在训练早期无显著影响,但随训练进行影响增大,与模型预测一致。

生信可带走

这一块是给做分析的人用的,不是科普点缀。

  • 方法栈: 光纤记录、光遗传学、化学遗传学、计算建模、行为学
  • 公开数据: 原文未给出公开组学登录号
  • 代码: 原文未给出公开 GitHub/GitLab 仓库
  • 谁该点开原文: 研究基底节、强化学习、多巴胺功能或习惯形成的研究者,以及计算神经科学建模者。

带走一句

多巴胺信号并非单一RPE,运动相关多巴胺可编码APE,作为无价值教学信号。分析多巴胺数据时需考虑行为背景和脑区异质性,不能简单归为奖励或运动。

本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

微信二维码

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。

添加微信

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。