论文

Stargazer:受天体物理约束的Agent模型拟合基准

Stargazer: A Scalable Model-Fitting Benchmark Environment for AI Agents under Astrophysical Constraints

智能体系统Agent任务评测

摘要

自主人工智能代理的兴起表明,需要具有对科学基础任务的内置反馈的动态基准环境来评估这些代理在研究工作中的能力。我们引入了 Stargazer,这是一个可扩展的环境,用于使用径向速度 (RV) 时间序列数据的推理来评估 AI 代理在动态、迭代的基于物理的模型拟合任务上的性能。 Stargazer 包含跨越三个难度级别的 120 个任务,其中包括 20 个真实档案案例,涵盖从高 SNR 单行星系统到需要涉及低 SNR 分析的复杂多行星配置等多种场景。我们对八个前沿智能体的评估揭示了数值优化和遵守物理约束之间的差距:尽管智能体通常能够实现良好的统计拟合,但它们经常无法恢复正确的物理系统参数,即使智能体配备了普通技能,这种限制仍然存在。此外,增加测试时间计算只能产生边际收益,过度使用词元通常反映递归失败循环,而不是有意义的探索。 Stargazer 提供了一个针对当今实际研究相关的模型拟合问题训练、评估、支架和扩展策略的机会。我们为人工智能代理设计模拟驱动环境的方法大概可以推广到跨科学领域的许多其他模型拟合问题。源代码和项目网站分别位于 https://github.com/AIPS-UofT/Stargazer 和 https://aips-uoft.github.io/Stargazer/。