论文
ECHO:使用轮级信用学习认知自适应语言智能体
ECHO: Learning Epistemically Adaptive Language Agents with Turn-Level Credit
摘要
对于语言智能体来说,自适应意味着什么?有效的多轮代理必须决定要寻求哪些信息、如何使用新证据以及何时有足够的把握采取行动。我们引入了认知决策过程(EDP),这是一种多轮信息搜索的信念状态公式,其中动作产生外部观察,更新代理对潜在任务变量的后验。 EDP 使认知适应性变得明确:好的政策选择在当前信念下有用的行动,而不仅仅是那些与最终成功相关的行动。我们证明,与信念无关的政策可能会遭受在未来呈指数级复合的错误,并且总轨迹回报可能无法识别认知贡献所需的每回合贝叶斯优势。然后,我们引入 ECHO(历史条件优化的认知贡献),这是一种实用的修剪策略梯度目标,它使用后验敏感奖励来分配轮次级贡献。在线索选择器游戏(一种新颖的受控证据寻求基准)中,我们表明,ECHO 比轨迹级 GRPO 显着提高了任务解决能力、信息增益和效率,并且在证据依赖、恢复和校准等认知指标上匹配或超过前沿基线,同时几乎不产生可见的推理文本。