论文

有据的自主研究:前沿计算物理中从语料到成稿的容错LLM管线

Grounded autonomous research: a fault-tolerant LLM pipeline from corpus to manuscript in frontier computational physics

应用与实践上下文与知识智能体系统上下文工程Agent Harness科学研究

摘要

自主研究智能体已在机器学习沙箱中展示端到端LLM自动化——其中执行本身提供校准。前沿物理科学有范畴性差异:物理推理是每个方法学选择的基础——工具链常常文档不足——校准必须来自外部文献锚点——而无脚手架的智能体只是引用却不面对这些锚点——从内部先验幻觉出貌似合理、不可验证的结果。我们提出一条端到端管线:从11,083篇近期凝聚态物理arXiv论文语料运行到一份达发表水准的手稿(含三项实质物理发现,此处为交变磁压磁性):智能体通过映射语料自主构思研究方向——通过复现已发表文献校准方法学——开展新颖的第一性原理计算——并撰写手稿——全程有文献支撑——跨六阶段的47个新上下文会话仅共享磁盘状态——共2,162次文献咨询事件。容错性源自冗余:新上下文隔离、分布式锚定与对抗性审查捕获任何单一会话遗漏的内容;试点前与试点后阶段完全自主——试点阶段仅在复现失败时需要有限的人类干预——是操作知识策展而非科学方向。两种成对失败模式——前架构基线与无试点消融——分离出校准检查点上结构性强制数值对照作为起作用的锚定机制。这些原语、刻画过的失败模式与量化干预模式为计算物理之外高风险科学领域的自主研究奠定基础。