Microsoft Research · 学术

用AI驱动解释与实验理解大脑

Understanding the brain with AI-driven explanations and experiments

二〇二六年六月二十五日 · 英文原文

微软研究院联合加州大学伯克利分校、加州大学旧金山分校和哥伦比亚大学开发了生成式因果测试(GCT),将LLM大脑预测模型提炼为简短文字解释(如“食物准备”),再由LLM编写新故事在fMRI中验证。实验确认了已知皮层选择性,区分了相邻地点处理区域(RSC、PPA、OPA),并发现前额叶中对对话、时钟时间和度量有选择性的微区域。相关论文被《自然·神经科学》接收。

用AI驱动的解释与实验理解大脑

基于LLM的模型能够以高精度预测人脑对语言的反应。但驱动这种性能的本质却难以解读:那是一大堆学习到的参数,而非任何人都能阅读的科学理论。生成式因果测试(GCT)由微软研究院、加州大学伯克利分校、加州大学旧金山分校和哥伦比亚大学合作开发,它将这些大脑预测模型提炼为简短的文字解释,说明每个皮层区域对什么做出响应:比如"食物准备"或"地点名称"之类的短语。然后GCT形成闭环:一个LLM编写旨在激活特定脑区的新故事,受试者在扫描仪中听到这些故事,只有当解释正确时,该区域才会被激活。在实验中,GCT确认了已知的选择性,区分了长期被认为可互换的相邻地点处理区域,并揭示了前额叶中微小的"微区域",这些区域对对话、时钟时间和度量等特定概念有选择性。

语言神经科学中的可解释性问题

过去十年间,LLM已成为我们预测人脑如何响应语言的最准确工具。将一个人在fMRI扫描仪中听到的同一个故事输入LLM,该模型的内部表示就能以惊人的保真度预测单个皮层区域的活动。但这种成功有一个代价:没有人能读懂这些模型。它们是数百万个难以理解的参数,无法直接转化为解释。一个能预测大脑活动的模型告诉我们某个区域对语言有响应,但无法告诉我们它实际上在捕捉什么——是食物、地点、数字,还是其他完全不同的东西。随着黑箱模型的普及,预测与理解之间的差距已成为计算神经科学的核心问题之一。

将黑箱转化为可检验的理论

在一篇被《自然·神经科学》接收的新论文中,微软研究院的科学家与加州大学伯克利分校、加州大学旧金山分校和哥伦比亚大学的科学家合作,引入了一个克服这种可解释性危机的框架:生成式因果测试(GCT)。GCT将大脑预测模型提炼为简短、可读的说明,描述每个皮层区域对什么做出响应,然后检验这些说法。一个LLM编写旨在激活特定脑区的新故事,受试者在扫描仪中听到这些故事,如果解释正确,目标区域就会被激活。结果是一种将不可解释的预测模型重新转化为科学通货的方法:可以在后续实验中被确认或反驳的简洁假设。

一个LLM编写旨在激活特定脑区的新故事,受试者在扫描仪中听到这些故事,如果解释正确,目标区域就会被激活。结果是一种将不可解释的预测模型重新转化为科学通货的方法:可以在后续实验中被确认或反驳的简洁假设。

图1. 生成式因果测试(GCT)的两个步骤。 步骤1中,最强烈驱动某个脑区预测模型的短语由LLM总结为简短候选解释,例如"食物准备"。步骤2中,LLM编写与解释相匹配的新故事,在扫描仪中测量该区域对这些"驱动"故事的响应,并与基线进行比较。

GCT的工作原理

GCT有两个步骤:解释,然后验证。为了生成解释,该方法从单个体素或区域的预测模型出发,识别出最强烈驱动其预测响应的短短语。然后LLM将这些词总结为简洁的文字解释,通常是一个短语,如"食物准备"或"地点名称"。关键的第二步形成闭环。为了建立对解释的信任,GCT使用LLM编写新故事,其中每个段落都经过精心构建,以根据其解释驱动某个脑区。三名受试者返回扫描仪阅读这些合成故事。如果某个区域对其"驱动"段落的响应显著高于基线文本,则该解释通过了真正的因果测试,而不仅仅是相关性测试。在所有三名受试者中,核心方法都成立:合成故事可靠地将其目标区域驱动到基线以上,证实了GCT的简短解释捕捉到了皮层真正响应的内容。这些解释在底层大脑预测模型最强时也最可信(模型越稳定,其解释在扫描仪中被确认的可靠性越高)。在已知选择性的区域上验证了该方法后,研究人员将GCT应用于更困难的问题。

图2. 不同主题的GCT故事的大脑响应图。 一些图恢复了已确立的发现:解释"地点"在位置区域RSC、OPA和PPA中产生强烈响应。其他图独立确认了较新的假设:"食物准备"激活了腹侧枕叶皮层靠近梭状回面孔区(FFA)的一个区域。有些(如"生日")则无法清晰映射到任何已知结果,指向了未来研究的方向。

GCT还证明足够敏锐,可以解决长期存在的模糊性。三个参与处理地点的相邻区域通常被视为功能相似:压后皮层(RSC)、海马旁位置区(PPA)和枕叶位置区(OPA)。起初,为一个区域编写的故事也会激活其他区域。但通过生成差异刺激(旨在打开一个区域同时保持其邻居安静的故事),GCT将三者区分开来。例如,RSC对专有名词地点名称(如东京或康涅狄格)的响应更强,而非一般地点。这是一种原始预测模型无法自行提供的细微、区域特定的理论。

除了已知区域,作者还发现了新的前额叶"微区域"。通过扫描候选位置的网格并只保留最稳定的那些,GCT发现了这些以前未被映射的区域,它们对非常特定的概念有选择性:一个对人与人之间的对话有选择性(如"said"或"told"等词),一个对提及时钟时间("one o'clock")有选择性,一个对数字度量("50 feet")有选择性。这些是没有人去寻找的区分;它们之所以出现,是因为该方法能够提出假设并立即检验。

播客系列:医学中的AI革命,再探

加入微软的Peter Lee,探索AI如何影响医疗保健以及这对医学未来意味着什么。立即收听(在新标签页中打开)

意义与展望

GCT的意义远不止于神经科学。研究人员越来越面临同样的困境:一个预测完美但无法解释任何东西的模型。GCT表明,数据驱动的模型不必是探究的终点;它可以被提炼为可读、可实验检验的理论,并且可以通过按需生成新实验来对照现实检验该理论。具体到神经科学,GCT指向了一种更快、更富含假设的皮层映射方式——AI系统提出某个脑区可能编码什么,闭环实验在单一研究中确认或拒绝它。同样的生成与验证理念可以扩展到其他领域,在这些领域中,强大的预测模型已经超出了我们理解它们的能力。更广泛的教训是充满希望的:科学中黑箱模型的兴起不一定意味着人类可读理论的退却。有了正确的框架,两者可以共同进步。

致谢

这项工作由微软研究院、加州大学伯克利分校(Alex Huth、Bin Yu、Sihang Guo和Aliyah Hsu)、哥伦比亚大学(RJ Antonello,共同第一作者)和加州大学旧金山分校(Shailee Jain)合作完成。我们也感谢研究参与者和更广泛的语言神经科学社区,他们的工具和数据集使这项研究成为可能。

阅读论文(在新标签页中打开):《生成式因果测试:弥合语言神经科学中数据驱动模型与科学理论之间的鸿沟》,被《自然·神经科学》接收,代码见GitHub(在新标签页中打开)。

原文《用AI驱动的解释与实验理解大脑》首发于微软研究院博客。

译自 Microsoft Research · 学术 · 录于 二〇二六年六月二十五日