技术实践
淘宝交易以预置标签和语义匹配迭代舆情分类
概述
分类能力经历三个阶段:阶段一把舆情批量投喂大模型自由归类,随数据量增大出现上下文超限、输出条数与输入条数对不上。阶段二改为结构化精简后单条投喂,准确率提升但因大模型概率性本质出现同义反馈被归为不同类别的聚类噪音(如「不支持暗黑模式」与「无法使用暗黑模式」),影响聚合统计可用性。阶段三确定最终方案,由业务人工梳理各业务线(评价、物流、下单、逆向、购物车、订单、支付、问大家等)历史舆情打标形成标准分类体系与典型关键词,LLM 任务从「自由归类」变为「语义匹配」,只判断反馈最接近哪个已有类别,从而让分类边界可控、结果一致、可解释可迭代。 第四闭环学习环节仍在持续完善:按设定周期对未匹配舆情池批量做 LLM 语义聚类与话题发现,提交业务人员人工审核确认后,把新问题类别与关键词写入对应业务线知识库,形成「知识库持续丰富→匹配率提升→未匹配减少→分类更精准」的正向循环。