论文

Wnuan:面向企业专有知识问答的分阶段后训练

Wnuan: Staged Post-Training for Question Answering over Proprietary Enterprise Knowledge

模型训练强化学习

摘要

企业问答要求模型学习专有知识,同时保留通用能力。我们提出Wnuan三阶段流程:从文档构造面向任务的监督数据,通过通用数据回放进行监督微调,再针对剩余错误进行强化学习。在707题的WnuanBench上,主要32B路径将可接受回答率由适应前52.76%提高到监督微调后80.06%,强化学习后达到91.51%。在匹配的100次更新协议下,残余错误采样分别比全池采样和同规模随机采样高3.11与2.97个百分点。两个比较的来源聚类自助区间均高于零,同领域验证集保持相同排序。整个路径的通用基准均分下降5.17个百分点,主要集中在指令遵循。自动评测集成与权威领域专家在分层抽取的Wnuan-Inst回答样本上达到90.5%一致率。结果同时刻画分阶段企业适应的收益与通用能力代价。

Wnuan:面向企业专有知识问答的分阶段后训练:论文配图
图 1:Wnuan 训练路径、主要 32B 结果、上下文系统和 WnuanBench 构建。 (a) 将企业文档转换为面向任务的 QA 监督,用于具有通用数据重放的 SFT,然后通过残差 RL 重新访问。 (b)水平位置是WnuanBench AAR,垂直位置是非幻觉率,气泡区域编码正确性。灰色 API 点和虚线 671B 连接器提供上下文。实线 32B 路线是主要轨迹。 (c) 堆叠条将 Base-to-RL 端点差异分解为 Base-to-Inst 和 Inst-to-RL 增量。 (d) WnuanBench 遵循与培训-QA 构建不同的特定基准筛选、专家评审和质量保证路径。