技术实践

京东保险算法团队训练保险领域小模型支撑全链路保险任务

模型训练监督微调与指令调优

概述

与履约理赔审核、反欺诈风控两条案例同源,本条是同一篇文章中的模型底座部分,为前述应用提供领域模型支撑。京东保险算法团队以持续预训练、监督微调、对齐优化三阶段训练保险领域小尺寸模型,融合精算级条款库与真实电商行为数据;少样本训练上参考 SHADOW-FT 思路,先在 base 模型上做 SFT 与对齐,再把参数变化叠加回 Instruct 模型,降低对昂贵指令数据的依赖并缓解知识遗忘;样本用种子数据经 WizardLM、MAGPIE、GraphGen 等多种方法合成。测评自建八维度保险榜单,从通用、保险通用、业务三方面覆盖多选、判断、问答与多轮对话及三档难度。模型以 LLM as Agent 方式调用外部工具、实时取数,独立完成产品对比、方案定制、核保咨询。团队解释选小尺寸是为满足线上实时性与成本,业务稳定后再逐步加大。口径为团队自述。