论文
不必求解,只需比较:用于LLM智能体运行时干预的微型顾问
Don't Solve, Just Compare: Tiny Advisors for Runtime Intervention in LLM Agents
摘要
LLM智能体正在成为需要推理、工具使用和序贯决策的现实任务的重要范式。随着这些智能体在更长时域上运行,运行时干预提供了一种无需重新训练底层actor就能提升可靠性的途径。仅有失败检测并不足够,有效的干预还必须为恢复提供有用的方向。现有方法通常依赖专家求解器,或依赖生成任务特定纠正的评论者,要么承担再养一个强求解器的成本,要么承担具备任务能力的评论者的容量需求。我们提出COTA(Comparison-Only Tiny Advisor,仅比较微型顾问),一个只靠比较实现建设性运行时干预的框架。在COTA中,一个微型比较器判断采样出的备选方案是否比actor的提议带来更好的后续,重复比较决定何时进行干预。我们用由同前缀反事实分支构建的成对监督来训练比较器。被偏好的备选方案作为非约束性建议返回,由原actor自行重新规划。在WebShop、ALFWorld和tau^3-Retail上配合三个actor,COTA改进了全部九个评估设置并超越所比较的基线。这些结果表明,即使辅助模型的任务求解能力远弱于actor,建设性运行时干预仍可保持有效。