论文

AhaBench:代理能否将经验转化为可重用的见解?持续学习的长期基准

AhaBench: Do Agents Turn Experience into Reusable Insights? A Long-Horizon Benchmark for Continual Learning

智能体系统Agent任务评测

摘要

语言代理能否不断从经验中学习,将早期的交互转化为可重用的功能? AhaBench通过解决隐藏状态谜题后的探索、数学教学后的计算迁移以及延迟反馈下的持续业务运营来评估这种能力。该基准与代理如何学习无关;评估的代理使用固定的模型权重。课程概况、教学对比和日常轨迹揭示了一个共同的挑战:使用明确的指导比泛化超越它或维持有用的行为更可靠。在整个 Puzzle 面板中,有迹线支持的匹配冷目标比无迹线端点的优势高出 36.0-53.5 分;尽管如此,Qwen 3.6 Plus 仍保留了 +12.57 分的课后收益。在 Euler 中,工作程序在各个模型中产生 80.0-100.0% 的保留准确率,而问答教学则产生 0.0-73.9%。售货轨迹分为持续盈利、后期复苏和运营不彻底:豆宝种子2.0 Pro完成名义运营价为+495,但全年平均运营率为-10。总之,这些结果使持续学习成为一个可操作的目标:经验应该产生随着指导、输入和业务状态变化而保持有效的能力。我们为开发代理发布任务、验证器、模拟器、记录和分析,将有用的见解转化为持久的能力。