论文

TRACE:用辩论轨迹与答案完整性约束增强 RAG 抗冲突能力

Parameters vs. Context: TRACE Fine-Tuning for Robust Retrieval-Augmented Generation

模型训练上下文与知识监督微调与指令调优检索增强

摘要

RAG 通过外部上下文缓解 LLM 知识过时与事实幻觉,但检索知识与内部参数知识冲突时,模型可能盲从误导上下文,或错误依赖参数知识,产生不可靠回答。TRACE(辩论轨迹与答案完整性正则化微调)针对这一问题。首先,方法利用多智能体辩论轨迹提取正确候选、错误候选和答案转移模式,为可靠选择知识源提供细粒度监督。其次,以答案尾部 token 强化和过早终止抑制构成答案完整性正则,减少空回答、过短回答及提前结束。微调目标结合正确答案监督、错误候选抑制、答案尾部强化和过早终止抑制,使模型利用可靠外部上下文、抵抗误导或无关检索内容,并在检索证据不可信时回退到参数知识。多个知识冲突场景及数据集上的实验表明,TRACE 提高对误导检索知识的鲁棒性并减少不完整回答,说明辩论轨迹和完整性约束可共同改善 RAG 的知识源选择、冲突鲁棒性和答案质量。代码见 https://github.com/PHD-lanyu/TRACE。

TRACE在数据构建阶段使用辩论暴露错误,再以轨迹监督和答案完整性正则微调。
图2(图注摘要):TRACE在数据构建阶段使用辩论暴露错误,再以轨迹监督和答案完整性正则微调。