论文
Mechanist:作为科学仪器发现智能机制的AI
Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of Intelligence
摘要
AI模型正越来越多地用于科学发现和人类决策。然而AI模型如何工作以及它们带来哪些风险仍然知之甚少。随着AI开发变得更快速、更自动化,关于AI底层机制的研究在很大程度上仍依赖人工。为弥合这一差距,我们提出Mechanist,一个以AI为科学仪器来自主发现AI底层机制的agentic系统。为锚定新的机制假设,我们构建了包含13,000项AI机制研究的科学知识图谱,以及覆盖26个领域、4,300万篇论文的多学科数据库。为可靠执行实验,我们整理了包含32种机制分析基础方法的库。与Claude Code和现有AI科学家系统相比,Mechanist生成更高质量的机制假设,并更可靠地执行实验。在四个案例研究中,Mechanist自主发现新的模型行为及其底层机制,并将这些发现转化为机制引导的干预和跨学科设计。具体而言,Mechanist首先揭示了科学实验室中一个反直觉的安全风险:不安全特质可以通过看似安全的训练数据迁移到微调后的学生模型,并跨模态出现。Mechanist随后发展了信念的机制理论,揭示模型如何表征世界知识、形成信念、推断他人信念,以及这些机制如何在预训练中涌现。基于这一理论,Mechanist开发了针对性的干预措施,在多样场景中提升模型性能。最后,Mechanist还能通过机制化设计推进跨学科发现,为计算密集的生成-重排范式提供替代方案。
