论文
验证者引导的可解释推理框架,具有金锚 QLoRA、任务感知专家混合和组相关 RLVR
A Verifier-Guided Explainable Reasoning Framework with Gold-Anchored QLoRA, Task-Aware Mixture-of-Experts, and Group-Relative RLVR
摘要
大语言模型(LLM)表现出很强的推理能力,但他们的解释可能不一致、缺乏依据或难以验证。我们提出了一个验证者引导的可解释推理框架,用于透明的教育问答,该框架结合了标准答案锚定的 QLoRA、任务感知符号路由和组相关 RLVR。 Qwen2.5-3B-Instruct 首先采用基于权威答案的字段加权 QLoRA 监督。然后,轻量级路由器将逻辑问题分配给 FOL/Z3 验证器,将物理问题分配给公式和单位感知符号求解器。验证者的反馈进一步用于支持 RLVR 期间的候选人评估、自我修订和奖励构建。候选人的回答按照三个互补的维度进行评估:P1 代表答案正确性,P2 代表证据或单元一致性,P3 代表推理深度和可解释性。在推理时,无金自我一致性会在可选的纯问题物理验证器执行保守的系统级校正之前聚合多个候选响应。在 438 个保留的示例中,RLVR 将 P3 从 50.68% 增加到 72.20%,而混合 P1 保持大致稳定在 55.94%。自一致性仅将模型 P1 从 48.86% 提高到 50.23%,符号验证提供剩余的混合增益。这些结果表明,RLVR 主要加强显式推理结构,而符号验证通过提高系统级别的答案可靠性来补充神经策略。