论文

把交互式任务对齐形式化为POMDP

Interactive Task Alignment as a POMDP

智能体系统Agent任务评测

摘要

当前语言模型基准主要评估在完全指明任务上的执行。然而真实用户任务往往是含糊的:用户带着不完整、探索性甚至不一致的目标而来,要求助手先确定任务意图再执行。我们以任务对齐为题研究这一问题——与用户就其意图任务达成一致的能力。我们引入一个把指明任务转为欠指定交互的通用框架,形式化为POMDP:模型必须从部分且演化的用户意图中推断潜在任务。我们以人类用户研究对用户模拟器做事后验证。横跨购物、编程与专业工作场景,我们发现:任务一旦指明,模型往往表现良好,但在任务对齐上仍然挣扎——现有模型过早行动、交互低效、无法解决含糊请求。在含糊条件下,模型平均只有22–32%的情况恢复出用户意图任务;同设置的人类研究达到48%,超过所有受评模型。监督微调与强化学习的后训练能改善任务对齐,但模型在通过交互解决不确定性上仍落后人类。综合来看,当前模型仍缺乏可靠智能体所需的关键交互能力。

把交互式任务对齐形式化为POMDP:论文配图
图 1:不确定性下的任务调整。用户提供可观察的指令,而他们的真实需求仍然是潜在的。我们研究任务对齐阶段:在执行任务之前通过交互来确定预期任务。尽管任务执行可能涉及其他潜在环境状态,但这些下游执行动态超出了范围。