论文

通过未来反馈预测实现开放式对话技能的可验证自我进化

Verifiable Self-Evolution for Open-Ended Dialogue Skills via Future-Feedback Prediction

智能体系统Agent Harness

摘要

文本技能提供了一种轻量级的方法来改进冻结的语言模型代理,但它们的自我进化通常需要稳定的验证信号。这种信号在数学或代码中是很自然的,答案发生变化后可以进行检查,但在开放式对话中却存在问题:更改助理响应也会改变用户的下一个反应,因此记录的反应无法直接评估反事实响应。我们提出未来反馈技能进化,它首先将自我进化从规定当前答案重定向到预测观察到的答案是否会导致积极或消极的后续用户信号。该预测任务可以在固定记录的元组上进行验证,因此支持验证门控文本优化。进化后的反馈技能捕获了响应质量的可解释标准,并且随后可以作为回答技能的诊断和优化目标。在专有的、保护隐私的销售助理数据集上,仔细的质量过滤和平衡的已解决/未解决的分割产生了超过 75% 的预测准确性。除此之外,核心贡献是一种公式,可以将移动的对话反馈转换为固定的离线学习目标,从而实现可重复的技能进化,而无需将每个候选技能都放在实时流量中。我们讨论了观察验证和反事实有效性之间的界限,并将该方法定位为离线优化阶段,而不是最终人工或在线评估的替代。