论文

可靠的结构化 LLM 生成的交互式批判修订训练

Interactive Critique-Revision Training for Reliable Structured LLM Generation

模型训练强化学习

摘要

在表单填写、合规性检查和维护报告等结构化决策工作流程中,LLM 输出必须本地正确、全局一致,并且可根据特定于任务的规则进行审核。现有的细化方法通常依赖启发式辩论、自我对弈或 LLM 生成的监督,从而产生二阶保证问题。我们提出了 DPA-GRPO(双配对动作组相对策略优化),这是一种用于两人生成器验证者游戏的配对动作训练方法,具有结构化验证者干预。生成器提出输出并可以在受到挑战时对其进行修改;验证者要么保持沉默,要么提出包含主张、论据和证据的安全保证案例 (SAC)。这些 SAC/no-SAC 和 KEEP/REVISE 决策会引发配对的反事实行动组,DPA-GRPO 将其用于角色特定的 KL 正则化 GRPO 更新。我们分析了非正规博弈,并表明严格的低回报干预或修正行动的正概率会产生有利可图的单边偏差。在标准随机逼近假设下,DPA-GRPO 跟踪相应的博弈 ODE,其孤立渐近稳定极限点是平稳的,并且是角色局部最优下的候选局部均衡。 TaxCalcBench TY24 上的实验表明,与 Qwen3-4B 和 Qwen3-8B 的零样本生成和仅生成器 RL 基线相比,DPA-GRPO 提高了结构化决策的准确性。训练增加了正确的无声接受,减少了遗漏的错误,并改善了校准的修订行为,这表明生成器和验证器都有所收获。