技术实践

淘天交易以Spec平台串联需求到研发评审

应用与实践上下文与知识智能体系统AI 基础设施模型评测上下文工程检索增强知识库智能体互操作协议Sandbox基准与评测资源评测方法与指标模型能力评测编程MCPAgent Sandbox

概述

针对交易领域合规要求高、历史包袱重、容错空间小、领域知识密集的特点,团队构建 Spec 平台,用 proposal.md/design.md/tasks.md 三文件结构把 PRD 分析、任务拆解、技术方案、代码实现全链路规范化:AI 辅助解析 PRD、基于应用/模块自动拆分任务、召回知识库生成初版方案、再基于规范化方案生码。工程上先用 Python SDK 打通公司 ideaTalk 的 ACK 到外部商业模型(claude-sonnet-4-5)的联通性并做可视化调优,最终采用「SOTA 模型 + Aone Agent」双通道,沙箱选 AoneSandbox 的弹内测试网模式以兼顾公网访问与拉仓库/内部 MCP 服务。2026 年 1 月基线:提案 8 分钟、方案 4 分钟、生码 15 分钟、端到端 30 分钟、研发效率提升比 40%;覆盖领域数 2 个、周活跃用户 8 人、人均使用频次 2 次、NPS 4.5。 为解决模型生成提案时上下文不足导致的编程幻觉,团队把领域知识拆成两层:知识点是细粒度、轻量化的一句话知识单元,用于概念澄清与认知校正(如 Aone 变更与代码仓库分支的关系、Diamond 配置与 Tair 缓存的使用场景区分、业务术语到代码位置的映射);知识库是组织化存储,解决通用模型无法覆盖的专有知识召回。针对 MCP chunk 召回「盲检索、断语义」的问题,构建两条互补链路:KBase 语义召回负责广度、用向量检索找语义相关内容;索引导航式召回先筛文档再下载本地用关键词精确搜类名/方法名,保证可追溯可解释。知识点最初全量注入 Prompt 导致上下文膨胀与幻觉,改为为每个知识点增加触发关键词字段,命中后再召回对应内容。 团队从质量、效率、使用度三维建评测:质量用 F1-score 度量,取 CR 中第一次 commit(AI 生码结果)与最后一次 commit(最终版本)做行级 diff 比对,计算有效率 Precision(最终成果中来自 AI 的比例)与保留率 Recall(AI 写的被保留比例)。2026 年 1 月基线为 F1-方案 94.44%、F1-代码 62.66%;单次样本 F1-doc 88.9%、F1-code 47.13%,保留率 56.94%。效率侧基线为提案 8 分钟、方案 4 分钟、生码 15 分钟、端到端 30 分钟、研发效率提升比 40%;使用度侧覆盖领域 2 个、周活跃 8 人、人均 2 次、NPS 4.5。已识别行级 diff 评测把等价重构误判为低分的局限,规划引入 AST 语义级评测、以 PRD 功能点为锚点的意图对齐评测,并在 CI 埋点识别 spec 生成 commit、CR 合并时自动触发评测回写,形成评测—归因—优化闭环。