论文

PragReST:用于语用语言理解的自我强化反事实推理

PragReST: Self-Reinforcing Counterfactual Reasoning for Pragmatic Language Understanding

模型训练合成数据

摘要

自然语言理解通常依赖于隐含的含义而不是明确表述的含义,需要实用推理。尽管在数学和逻辑推理方面表现出色,但 大语言模型 (LLM) 仍然难以做出实用的推理,经常选择字面解释。为了改进 LLM 实用推理,我们引入了 PragReST,这是一个自监督框架,它构建实用 QA 数据,生成反事实推理轨迹,并训练模型通过监督 微调 和强化学习将其内化,而无需人工标记的训练数据或来自更强教师的 蒸馏。在四个实用基准(PragMega、Ludwig、MetoQA 和 AltPrag)中,PragReST 改进了主干模型、特定于任务的实用调整基线和同一管道的非反事实变体。在基于准确性的基准测试中,PragReST 相对于 Qwen3-8B 和 Qwen3-14B 的指令主干分别提高了 5.37% 和 5.50%(绝对值)。我们的错误分析和消融强调了反事实推理的重要性:PragReST 主要减少了由于未能将观察到的话语与合理的替代方案进行对比而导致的错误,而消除反事实推理会大大降低性能。此外,我们的训练保留了一般知识和数学推理基准的域外性能。