论文
CalVerT:通过校准验证器遥测增强代理可改善知识密集型任务中的行动和学习
CalVerT: Augmenting Agents with Calibrated Verifier Telemetry Improves Action and Learning in Knowledge-Intensive Tasks
摘要
知识密集型问答中的 LLM 智能体采取检索和推理操作,但不完全了解当前答案是否不确定、不受支持或已经完整。这会产生两种失败模式:提交自信但不受支持的答案,这会损害准确性;当手头的证据已经足够时,过度检索,导致计算浪费。为了让代理更全面地了解他们正在运行的状态空间,我们引入了校准验证者遥测 (CalVerT),它通过额外的遥测来增强代理的状态:校准的自信分数和证据关联验证器分数。我们证明 CalVerT 可以在 无需训练 和基于训练的设置中改进代理。在四个 QA 基准上,我们发现 CalVerT 通过在智能体过度依赖参数知识的情况下触发检索来提高 F1,同时在智能体有足够的上下文来回答的情况下减少冗余检索。我们证明 CalVerT 无需训练即可增强现有的 QA 框架。此外,CalVerT 还改进了经过训练的系统:通过简单地通过遥测增强代理的状态,与经过相同训练但没有 CalVerT 遥测的代理相比,我们观察到强化学习后的改进。