论文
ARAC-Bench:评估自动化研究与人类研究过程对齐性与完备性的基准
ARAC: Benchmarking Auto-Research's Alignment and Completeness on End-to-End Researchs
摘要
Auto-Research 的快速发展凸显出一个根本性的评估挑战:如何衡量其研究轨迹与人类研究行为之间的对齐性、逻辑连贯性和演化完备性?我们提出 Auto-Research 的对齐性与完备性基准 ARAC-Bench:一个模仿研究者的评估框架,将目标从匹配最终答案转向复现高质量的人类研究过程。该框架通过两个协同组件运作:一是学术认知技能系统(Academic Cognition Skills),首次将隐性的审稿人专长转化为分阶段校准、可量化的评分规则;二是三阶段能力诊断协议,在严格模块化约束下把研究过程分解为可追溯、相互独立的三个维度:Proposal、Experiment 与 Synthesis。对 11 个 SOTA 框架的系统评估显示,最佳对齐得分仅为 100 分中的 67.9,揭示出其在模拟严谨人类方法论方面的显著差距。与博士生排名的验证显示强相关性 0.8141,证实 ARAC-Bench 能可靠反映研究者真正看重的维度。ARAC-Bench 不仅提供了细粒度诊断工具,还为训练下一代自主研究系统提供了可扩展的奖励信号。
