论文
HypoForge:一种自我改进的多代理框架,用于通过科学技能学习自动生成和测试假设
HypoForge: A Self-Improving Multi-Agent Framework for Automated Hypothesis Generation and Testing via Scientific Skill Learning
摘要
大语言模型(LLM)使AI科学家系统能够实现科学发现的自动化,但现有方法大多依赖静态提示或固定工作流程,无法积累持续改进的经验。我们提出了 HypoForge,这是一种经验引导的多智能体框架,可以学习可重复使用的科学技能,以自动生成假设和检验假设。 HypoForge 是基于对这两个阶段涉及不同监督信号的观察而建立的。对于无法获得明确反馈的假设生成,HypoForge 采用对抗性生成器-判别器机制,通过比较批判来改进推理。对于假设检验,在可以获得经验反馈的情况下,HypoForge 从执行结果和 真值 结果中学习测试技能。通过将技能学习策略与特定阶段的监督相匹配,HypoForge 无需 微调 基础模型即可实现持续改进。假设生成和测试基准的实验表明,HypoForge 始终优于现有的人工智能科学家框架和技能水平变体。进一步的分析证明了所提出的特定阶段技能学习范式的有效性。