淘天以意图识别和并行检索改进AI答疑
概述
淘天跨端技术团队维护的面向内部开发者 AI 答疑助手(覆盖前端研发框架、开发平台、工具链、跨端组件,并直连研发平台查询构建/发布/监控状态)初期采用 Naive RAG,上线后出现对提问方式敏感、知识碎片化、缺乏评测闭环三个瓶颈。团队把"过一层模型做 query rewriting"改为基于思维链的多步查询分解与并行检索:先用 qwen-turbo-latest 识别核心意图,再让模型输出解决问题的思维步骤,据每个步骤生成多组查询关键词,最后并行送知识库召回、汇总去重后交给答疑模型;相比串行改写可一次产出十几条覆盖不同维度的查询。 团队先用微软 GraphRAG 在知识库某模块做了实验(44 篇文档,Streamlit 可视化图谱),跨文档综合与全局性问题回答质量确有提升,但工程化上出现索引构建成本高、不支持增量更新、Global Search 一次查询耗时 5 分钟以上、对抽取质量敏感四个问题,在实时答疑场景几乎不可用,遂改用 LightRAG。LightRAG 去掉社区发现与社区摘要,用 R(·) 实体关系抽取、P(·) 键值对生成、D(·) 去重合并三个函数构建索引,查询走低级检索(具体实体及直接关联)与高级检索(关系边上的全局主题关键词)双层范式同时触发。实测索引构建速度比 GraphRAG 快数倍,查询延迟从分钟级降到秒级,API 调用量与 token 消耗大幅减少,新增文档只需局部增量合并。 团队为答疑助手建立评测闭环:初版只有"好/坏"二分类,因无法区分根因而升级为问题质量、回答质量、问题成因三维标注体系,使每个 Bad Case 可归因到幻觉、召回不足、知识缺失或超出能力并对应处置;同时用一个 Agent 自动评测每条回答辅助人工标注,发现评测 Agent 存在显著"乐观偏差"——判为"需改进"的几乎都被人工确认为 Bad Case(精准率高),但判为"优秀"的仍有相当比例被人工标为"坏"(召回率低),因此确定人工校验环节不可缺失,并计划把评测 Agent 与多维度标注体系对齐。