论文
在改进之前学习评估:自动研究代理的自动评分表归纳
Learning to Evaluate Before Improving: Automatic Rubric Induction for Automatic Research Agents
摘要
自主科学研究代理越来越多地应用于端到端的科学工作流程,包括文献综述、数据分析、实验和报告生成。然而,开放式研究任务通常没有明确规定完成任务所需的分析、方法和成功标准。因此,智能体可能会错过重要的分析、使用不适当的方法或得出证据不足的结论。为了解决这个问题,我们提出了 AutoSciRub,一个评估优先的框架,它在研究执行之前引入特定于任务的可执行标题,并用它来指导执行、标准级验证以及迭代修订。 AutoSciRub 将未指定的指令分解为原子科学目标,将其基于相关文献和任务可见数据,并综合具体的、可操作的和可验证的标准。由此产生的标题使隐含的实验和证据要求变得明确,为实验和分析提供指导。在修订过程中,以标题为指导的验证可识别未满足的标准,并能够有针对性地改进研究报告及其支持工件。在 ResearchClawBench 上,AutoSciRub 持续改进了所有测试的配置,在固定 Codex 框架下的三个主干 LLM 中平均增益为 2.08 点,在使用固定 DeepSeek-V4-Flash 主干的三个代理框架中平均增益为 2.95 点。在 AstaBench E2E Discovery 的随机采样的 20 个任务子集上,AutoSciRub 在三个代理工具中进一步实现了 16.8 点的平均改进,同时保持或增加了成功完成的任务数量。这些结果表明,评估优先的指导为自主科学研究提供了有效且可推广的控制机制(代码:https://github.com/zjunlp/AutoSciRub)。