论文

什么驱动了来自反馈的交互式改进

What Drives Interactive Improvement from Feedback?

模型评测模型能力评测

摘要

我们研究自然语言反馈何时产生超越仅通过重复尝试获得的收益的改进。在多轮语言代理设置中,更高的最终精度可以反映有用的反馈,但它也可能来自重采样、格式校正或额外的测试时间计算。为了区分这些影响,我们引入了跨 Omni-MATH、Codeforces、BBEH Linguini 和 ARC-AGI1 的受控学生-教师协议,评估学生和教师角色的 13 个开放权重模型。我们比较外部反馈、自我反馈和无指导的自我完善,同时改变交互历史、任务难度和教师对特权任务信息的访问权限。在各种环境中,我们发现多轮改进通常并不是反馈使用的证据:自我生成的反馈除了无指导的自我完善之外几乎没有什么增加,而最强大的外部教师会产生更大的特定反馈收益,这表明有用的反馈必须提供超越一般重试的指导。密集的学生-教师互动矩阵进一步表明,互动收益更多地是由学生使用反馈的能力驱动的,而不是由教师的身份驱动的,尽管教师的选择对于固定的学生仍然很重要。这些结果表明,基于反馈的代理应该根据重复尝试的基线进行评估,并且根据反馈采取行动的能力,而不仅仅是反馈可用性,是交互改进的中心瓶颈。我们在 https://j-lojek.github.io/feedback- Generation-is-a-bottleneck/ 发布了受控的学生-教师评估框架。