论文

精确反馈无法控制:评估大语言模型中基于文本的闭环修订

Exact Feedback Is Not Control: Evaluating Text-based Closed-Loop Revision in LLMs

模型评测模型行为与机制分析

摘要

闭环修订越来越多地用于大型语言模型(LLM)应用程序,但失败可能反映出反馈不完整或对正确反馈的无效响应。我们引入了带有确定性验证器的固定预算修订协议,该验证器报告跨精确长度、词汇和组合约束的所有剩余违规行为。修复反馈的正确性和完整性可以隔离模型端的修订行为。在 19 个开源和闭源模型中,控制器级别的平均最终联合成功率在 17.4% 到 99.8% 之间,在相同的初始草案下仍然存在巨大的跨模型差距。对照实验揭示了对精确反馈的可重复的模型特定响应。训练后和规模重塑了这些反应,但没有始终如一地使它们更接近精确的校正。在所有约束族中,失败的轨迹通常会重复早期的输出,并且先前的重复与较低的后续可恢复性相关。匹配状态干预表明,在保留当前草案和反馈固定变化的同时取消早期对话,不会可靠地提高最终成功;效果取决于模型、任务和触发状态组成。精确的反馈使得修正错误可以被观察到,但并不能使闭环变得可靠。代码和复制说明:这个https URL。