论文
MIRA元推理研究智能体
Learning What to Investigate Next: Meta-Reasoning for Long-Horizon Research Agents
摘要
长程研究智能体必须随着证据积累决定如何调查以及下一步调查什么。这难以学习,因为此类决策在长执行轨迹中稀疏,其后果可能几步调查之后才显现。我们提出面向迭代研究智能体的元推理(MIRA),一个把研究资源分配与执行分开的分层架构。外环元推理器从持久研究记录中策划上下文,然后写下一次调查的工作指令或结束回合;新鲜的内环执行器执行每份工作指令,使执行成为元推理动作之间的转移。在不做策略训练的情况下,MIRA改善长程推理并更有效地分配额外算力,覆盖定理证明与开放神经架构研究。其决策边界为信用分配提供了自然单元:在每个边界上训练生成式批评家从部分状态预测期望剩余回报,优于token级替代方案。跨环境预训练改善预测与适应,产生可迁移的部分进展估值先验。我们用该先验初始化MIRA-AC——一个联合训练预测剩余回报与选择下次调查的生成式actor-critic,无需独立批评家模型。MIRA-AC把策略优化集中在元推理决策上,使长程强化学习无需直接优化其触发的更长执行轨迹。在四个自动研究环境上用模型自身的代理爬山信号训练MIRA-AC提升金标准性能;actor经跨环境价值初始化可迁移。这些结果表明元推理可以被学习为指挥长程自主研究的显式策略。