技术实践

阿里MktAI用语义、推理检索和本体改善取数

上下文与知识应用与实践检索增强知识库知识图谱本体AI语义层结构化分析、预测与决策

概述

阿里MktAI团队早期用「知识库 + Prompt Engineering + Function Calling + Few-shot」搭数据 Agent,遇到 RAG 幻觉与语义断裂、元数据黑话(尖货、焕新补贴、分层 GMV)读不懂、Prompt 规模化维护难、链路过简牺牲泛化四类问题,转向 Context-Aware 知识工程:一、结构化数据语义层增强,字段从「叫什么」扩到计算逻辑、值域特征、典型场景、常见误用反例(如商家公域到手价 = 基础价 - 可叠加优惠 + 排他规则校验),并用正反例对比 SQL 让模型学会枚举值匹配。 血缘语义化显式建模「优惠券 ID→影响→订单折扣金额」「活动商品标识→关联→尖货池」并支持跨表推理。新增元数据由 7×24 AI 助手评审定义冲突与口径严谨性。监听 MaxCompute / Hologres 的 DDL/DML 变更触发同步,由 LLM 基于上下文自动生成初步语义解释、人工确认后入库。 数科与运营专家经验沉淀为可按需加载的分析模块。二、RAG 从 Vector-Based 升级为 Reason-Based:多模态模型解析图表截图并回填、基于符号结构建 ToC Tree、合并低 Token 子树做树形瘦身、生成 search_tree(召回)与 full_tree(生成)双视图,检索阶段由 LLM 扮演文档专家推理出相关节点,支持跨章节关联与扩展计划导航、多文档并发且仅 Top-K 进入生成。 三、构建业务本体:与架构师共同抽象对象类型(Item/Brand/Activity/ComparisonPool 及主键与属性)、关系类型(ItemComparesWithItem、ItemUsesDiscountTool,带方向与基数)、动作类型(QueryComparisonStatus,含计算逻辑、SQL 模板与规则)。 效果:营销活动场景 350+ 评测集上,DataAgent 引入元数据与黑话后泛化取数(兜底)准确率由 86% 提升至 95%。相同营销知识语料下 Reason-Based RAG 在 58 条子域评测集(前 N、预售、官方立减)上人工好评率 98%(传统 Vector-Based RAG 约 30%)。 本体驱动 Agent 在 300+ 评测集上,购后价格场景归因合理性 89%、本体召回率 82%、推理完整性 89%,大促价格管控场景分别为 94%、90%、92%。