论文
诊断语言智能体的任务不敏感性
Diagnosing Task Insensitivity in Language Agents
摘要
大语言模型可作为有能力的长程智能体——但其分布外(OOD)泛化仍然弱。我们把该失败的一个关键来源识别为任务不敏感性:面对相似但不同的任务时——模型可能应用训练期间学得的模式——未能解决当前任务。我们表明:即使指令被语义破坏、无法直接回答——模型常继续执行与原任务对齐的动作。我们进一步发现——当把训练提示中的任务描述替换为另一相似但不同的任务时——模型可能仍输出相同动作。该行为伴随一致的训练时注意力从任务token漂移向局部观察——提示对捷径的优化偏置。为缓解该问题——我们提出任务扰动NLL优化——轻量对比正则化——显式鼓励动作依赖于任务指令。大量评估表明我们的干预改进任务敏感性与OOD泛化——同时保持对任务token更稳定的注意力。
