Skip to main content
知识分享官

大型语言模型中隐藏的“奖励系统”:科学家揭示其神经机制近年来,随着大型语言模型(LLM)的快速发展,人们对其内部工作原理产生了浓厚兴趣

  1. 大型语言模型中隐藏的“奖励系统”:科学家揭示其神经机制

    近年来,随着大型语言模型(LLM)的快速发展,人们对其内部工作原理产生了浓厚兴趣。有研究提出,LLM的隐藏状态可能编码了与奖励相关的信息,比如回答正确性和模型信心。然而,这些信息在模型内部是如何组织、分布的,一直是未解之谜。最近,一项发表在arXiv上的研究揭示了其中的奥秘。

    研究人员发现,奖励相关信息并非分散在所有神经元中,而是高度集中在少数特定神经元上,形成了一个“稀疏奖励子系统”。他们通过简单的探查方法,识别出两种关键神经元:价值神经元,其激活程度能预测当前状态的价值;以及多巴胺神经元,其激活则编码了每一步的时序差分(TD)误差。这种结构与生物神经科学中的奖励系统有相似之处,生物中的价值神经元和多巴胺神经元分别负责编码价值和奖励预测误差。

    这项研究不仅为理解LLM的决策过程提供了新视角,还展示了实际应用价值。例如,价值神经元能有效预测模型对自身输出的信心程度,而多巴胺神经元则可被用作“过程奖励模型(PRM)”,在推理过程中指导搜索方向。不过,目前的研究主要基于特定模型和数据集,其普适性和泛化能力仍需更多实验验证。

    AI的“奖励系统”也太像生物了吧?🧠


    来源:arXiv

    #大型语言模型 #奖励机制 #神经科学 #AI行为 #时序差分误差

    🧬 频道🧑‍🔬 群组📨 投稿