论文

Mechanist:作为科学仪器发现智能机制的AI

Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of Intelligence

智能体系统Agent 架构与控制循环

摘要

AI模型正越来越多地用于科学发现和人类决策。然而AI模型如何工作以及它们带来哪些风险仍然知之甚少。随着AI开发变得更快速、更自动化,关于AI底层机制的研究在很大程度上仍依赖人工。为弥合这一差距,我们提出Mechanist,一个以AI为科学仪器来自主发现AI底层机制的agentic系统。为锚定新的机制假设,我们构建了包含13,000项AI机制研究的科学知识图谱,以及覆盖26个领域、4,300万篇论文的多学科数据库。为可靠执行实验,我们整理了包含32种机制分析基础方法的库。与Claude Code和现有AI科学家系统相比,Mechanist生成更高质量的机制假设,并更可靠地执行实验。在四个案例研究中,Mechanist自主发现新的模型行为及其底层机制,并将这些发现转化为机制引导的干预和跨学科设计。具体而言,Mechanist首先揭示了科学实验室中一个反直觉的安全风险:不安全特质可以通过看似安全的训练数据迁移到微调后的学生模型,并跨模态出现。Mechanist随后发展了信念的机制理论,揭示模型如何表征世界知识、形成信念、推断他人信念,以及这些机制如何在预训练中涌现。基于这一理论,Mechanist开发了针对性的干预措施,在多样场景中提升模型性能。最后,Mechanist还能通过机制化设计推进跨学科发现,为计算密集的生成-重排范式提供替代方案。

Mechanist:作为科学仪器发现智能机制的AI:论文配图
图2:Mechanist 概览与评估。a,Mechanist 框架包含四个阶段:假设生成、实验执行、验证与迭代。具体而言,假设生成受现有知识库中跨学科知识的启发,经 Mechanist 验证的新发现随后被加入该知识库。b,用于比较 Claude Code、AI-Scientist 和 Mechanist 的基准设计。该基准通过复现论文来评估实验执行的可靠性,并从新颖性、影响力和可检验性三方面评估所生成的假设。c,通过复现 16 篇已有论文评估的实验执行可靠性。实验结果由人类专家和 LLM 评审 Claude Opus 5 独立评估。d,人类与 LLM 对实验可靠性评估的一致性。每个点代表一次复现实验;虚线表示完全一致。e,为科学、语言、推理和安全领域任务所生成假设的总体质量。f,对 Claude Code、AI-Scientist 和 Mechanist 生成的假设在新颖性、影响力和可检验性三个维度上的评估。g,CC 所生成假设的新颖性–可检验性联合空间。