Skip to main content
知识分享官

Search: #奖励预测

在 来一点医学科学前沿🤯🤯🥹🥹 中搜索 订阅此频道的话题
  1. 大型语言模型中隐藏的“奖励系统”:科学家揭示其神经机制

    近年来,随着大型语言模型(LLM)的快速发展,人们对其内部工作原理产生了浓厚兴趣。有研究提出,LLM的隐藏状态可能编码了与奖励相关的信息,比如回答正确性和模型信心。然而,这些信息在模型内部是如何组织、分布的,一直是未解之谜。最近,一项发表在arXiv上的研究揭示了其中的奥秘。

    研究人员发现,奖励相关信息并非分散在所有神经元中,而是高度集中在少数特定神经元上,形成了一个“稀疏奖励子系统”。他们通过简单的探查方法,识别出两种关键神经元:价值神经元,其激活程度能预测当前状态的价值;以及多巴胺神经元,其激活则编码了每一步的时序差分(TD)误差。这种结构与生物神经科学中的奖励系统有相似之处,生物中的价值神经元和多巴胺神经元分别负责编码价值和奖励预测误差。

    这项研究不仅为理解LLM的决策过程提供了新视角,还展示了实际应用价值。例如,价值神经元能有效预测模型对自身输出的信心程度,而多巴胺神经元则可被用作“过程奖励模型(PRM)”,在推理过程中指导搜索方向。不过,目前的研究主要基于特定模型和数据集,其普适性和泛化能力仍需更多实验验证。

    AI的“奖励系统”也太像生物了吧?🧠


    来源:arXiv

    #大型语言模型 #奖励机制 #神经科学 #AI行为 #时序差分误差

    🧬 频道 | 🧑‍🔬 群组 | 📨 投稿
  2. 海马体如何预测奖励?研究揭示学习中的神经动态

    我们总在预测未来,比如考试后会不会有奖励?大脑中有一个关键区域——海马体,可能参与了这种预测。但海马体通常与空间记忆联系紧密,它如何处理奖励信息,尤其是在学习新任务时,一直是个谜。

    新研究跟踪老鼠学习奖励任务的过程,发现海马体的奖励表示会随经验变化。随着老鼠越来越熟悉任务,海马体中专门编码奖励的神经元比例减少,而那些代表任务中先于奖励的线索的神经元活动则增强。更关键的是,原本编码奖励的神经元,其活动逐渐转向预测这些先导线索,就像在任务开始前就“预知”了奖励。

    这表明海马体通过调整神经活动,从直接编码奖励转向预测先导特征,帮助动物更高效地学习。这种动态变化可能反映了大脑如何通过经验优化预测模型,但研究仅限于老鼠,是否适用于人类仍需进一步探索。

    大脑预测奖励这么“聪明”,居然还爱“偷懒”?🤔


    来源:Nature

    #海马体 #奖励预测 #神经科学 #学习机制

    🧬 频道 | 🧑‍🔬 群组 | 📨 投稿