论文
把交互式任务对齐形式化为POMDP
Interactive Task Alignment as a POMDP
摘要
当前语言模型基准主要评估在完全指明任务上的执行。然而真实用户任务往往是含糊的:用户带着不完整、探索性甚至不一致的目标而来,要求助手先确定任务意图再执行。我们以任务对齐为题研究这一问题——与用户就其意图任务达成一致的能力。我们引入一个把指明任务转为欠指定交互的通用框架,形式化为POMDP:模型必须从部分且演化的用户意图中推断潜在任务。我们以人类用户研究对用户模拟器做事后验证。横跨购物、编程与专业工作场景,我们发现:任务一旦指明,模型往往表现良好,但在任务对齐上仍然挣扎——现有模型过早行动、交互低效、无法解决含糊请求。在含糊条件下,模型平均只有22–32%的情况恢复出用户意图任务;同设置的人类研究达到48%,超过所有受评模型。监督微调与强化学习的后训练能改善任务对齐,但模型在通过交互解决不确定性上仍落后人类。综合来看,当前模型仍缺乏可靠智能体所需的关键交互能力。
