Hugging Face · Daily Papers

Mechanist:作为发现智能机制的科学工具的AI

Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of Intelligence

Mengru Wang, Junfeng Fang, Shuofei Qiao, Zhenqian Xu, Haoming Xu, Haoxiong Wang, Shumin Deng, Linyi Yang 等 19 位
来自 ZJUNLP
二〇二六年八月十三日 · arXiv:2608.12036 · PDF · Code

AI模型在多个领域取得了显著成功,但其能力背后的机制以及可能带来的风险仍鲜为人知。随着AI开发速度加快且日益自动化,机制探索仍主要依赖人工,这拉大了模型能力与我们理解、控制它们之间的差距。为弥合这一鸿沟,我们引入了Mechanist,一个智能体系统,利用AI作为科学工具,自主发现AI智能背后的机制。为支持自主机制发现,我们构建了一个聚焦可解释性的知识图谱,涵盖约13,000篇论文,并将其与一个跨26个领域、包含4300万篇论文的多学科数据库集成。我们还整理了一个包含32种基础方法的库,用于机制分析、因果干预和验证。与Claude Code及现有AI科学家系统相比,Mechanist能生成更有价值的机制假设,并更可靠地执行实验。Mechanist还展示了从发现模型行为到解释和控制AI模型的递进过程。具体而言,Mechanist首先揭示了科学实验室中一个反直觉的安全风险,表明不安全特质可通过看似安全的训练数据跨模态转移。随后,Mechanist发展了一套信念的机制理论,揭示了模型如何表征世界知识、形成信念、推断他人信念,以及这些机制如何在预训练期间涌现。最后,Mechanist将这些机制洞见转化为实际干预措施,提升了模型在多种场景下的性能,并引导科学基础模型生成具有指定属性的DNA序列。

译自 Hugging Face · Daily Papers · arXiv:2608.12036 · 录于 二〇二六年八月十三日