论文
有品位的Agent:长程任务中品味的度量与提升
The Tasteful Agent: Measuring and Improving Taste in Long-Horizon Tasks
摘要
LLM Agent越来越多地承担长程任务,它们在此过程中做出的决策——比如检验哪个假设、或基于哪个实现继续构建——决定了整次运行的结果。把这些决策做好,正在成为工程型与研究型Agent的关键能力。我们把做出良好长程决策的能力称为Agent的“品味”。现有基准衡量Agent在长程任务上的端到端成功率,却没有一个衡量Agent的品味。为解决这一问题,我们构建了Taste-Bench,一个从Agent在工程与研究任务中产生的轨迹里自动构建品味问题的基准。每个问题呈现一个决策分叉:轨迹中存在多个可选方向、其中之一通向更好结果的节点,被评测模型在不看到分叉之后发生什么的情况下在这些方向中做选择。我们从同一任务的并行尝试和单条轨迹内部的弯路中自动挖掘这些分叉,无需人工标注。我们在Taste-Bench上评测前沿模型,发现最好的模型也只能答对59.7%的问题。我们进一步发现,决定性证据出现在轨迹后段的分叉对所有模型都更难,而更大的推理预算并不能提升准确率。最后,我们证明品味是可以训练的:把见过结果的教师模型的判断蒸馏到学生模型后,学生在未见任务上做出更好的决策,并在留出的SWE-bench Pro任务上提升了端到端成功率。
