论文
Wnuan:面向企业专有知识问答的分阶段后训练
Wnuan: Staged Post-Training for Question Answering over Proprietary Enterprise Knowledge
摘要
企业问答要求模型学习专有知识,同时保留通用能力。我们提出Wnuan三阶段流程:从文档构造面向任务的监督数据,通过通用数据回放进行监督微调,再针对剩余错误进行强化学习。在707题的WnuanBench上,主要32B路径将可接受回答率由适应前52.76%提高到监督微调后80.06%,强化学习后达到91.51%。在匹配的100次更新协议下,残余错误采样分别比全池采样和同规模随机采样高3.11与2.97个百分点。两个比较的来源聚类自助区间均高于零,同领域验证集保持相同排序。整个路径的通用基准均分下降5.17个百分点,主要集中在指令遵循。自动评测集成与权威领域专家在分层抽取的Wnuan-Inst回答样本上达到90.5%一致率。结果同时刻画分阶段企业适应的收益与通用能力代价。
