论文
$R^3$-Bench:LLM 共享预算下资源理性推理的斗争
$R^3$-Bench: LLMs Struggle with Resource-Rational Reasoning under Shared Budgets
摘要
在认知科学中,资源理性询问智能体应如何分配有限的计算以最大化预期价值。大多数推理和代理基准测试都使用独立的每任务预算;现有的共享预算研究并未根据同一模型所展示的单问题能力来校准套件性能。我们引入了 $R^3$-Bench,它在无工具和代理环境中评估数学、竞争性编程和抽象推理的共享预算下的六个问题套件。匹配的单问题响应曲线定义了对观察到的成功的离线经验预言。在 6 个模型的 72 个主表单元格中,预言机平均值等于或超过所有单元格中的竞赛平均值,并且 71 个单元格中的平均值严格较高。在中等的无工具压力下,等分配重播也超过了 6 个模型中的 4 个模型的竞赛表现。轨迹诊断揭示了有限的策略更新和压力相关的故障模式。在强代理压力下的三模型诊断中,至少有一个固定调度程序在九个单元中的六个单元中超过了竞赛平均值,但没有策略在跨域中占主导地位。这些结果暴露了所展示的能力与共享预算实现之间持续存在的差距。