技术实践

得物以Galaxy MCP打通数据研发工具

智能体系统上下文与知识AI 基础设施上下文工程Agent 工具调用智能体互操作协议数据基础设施模型网关AI 开发与运维平台AI安全与内容治理基础设施MCP

概述

研发团队基于 MCP 为内部数据研发平台 Galaxy 构建标准化集成底座,让 Code LLM 不再依赖工程师手动复制表结构与日志。Galaxy MCP 提供统一 HTTP Streamable 接口与 Bearer Token 鉴权机制,使大模型可在安全受控前提下直接调用底层数据平台 API,并向模型暴露构成 Agent 任务原子的五类核心能力:分析数据结构(编写 SQL 前自动取目标表建表语句,确保字段名与类型准确以消除幻觉)、追溯数据来源(OneData 建模或排错时自动查上游血缘表梳理依赖链路)、逻辑审查(读取线上调度任务的真实 SQL 逻辑用于重构或口径比对)、排查任务失败(查找特定时间段内失败的运行实例)、根因分析(获取完整执行日志如 Spark 报错堆栈并结合上下文给出修复建议)。工程上已实现与主流 AI IDE 的无缝集成,开发者在 IDE 中输入「读这个表试试:xxx.table_name」等自然语言即可路由至 Galaxy MCP 并完成鉴权、API 调用与结果解析闭环。同期架构侧提出「认知运行时(LLM 负责语义推演,不触碰物理数据,只操作已授权元数据与 AST)/执行运行时(Spark、Flink、ClickHouse 等负责确定性算力)解耦」的范式,并明确数据确权的人机边界:管理审批由人类主导,技术实现由 Code LLM 在人工复核后执行。 为使 Code LLM 在容错率极低的数仓环境可控落地,团队建立了两类管控:幻觉风险抑制方面,严禁模型在无上下文情况下「裸写」SQL,必须通过 Galaxy MCP 实时获取真实表结构与分区信息,确保引用的表名与字段名真实存在(RAG 增强与 MCP 强绑定),且模型生成的 SQL 必须经数仓平台语法解析器做静态检查以阻断基础语法错误;数据安全与合规方面,鉴于数仓含大量商业机密与用户隐私(尤其调用外部公有云 API 时),在 Prompt 提交至模型前由网关层做正则表达式与 NLP 实体识别扫描,自动屏蔽或替换真实手机号、身份证号与真实交易金额等敏感数据,并实行元数据隔离——仅允许模型读取表结构 Schema 与脱敏后的 Mock 样例数据,严禁直接访问生产环境物理数据,同时规定所有 AI 辅助生成的代码变更在 Git 中必须带特定 AI 标签并记录对应 Prompt 与生成日志以便事后追溯。此外所有 Prompt 作为「认知运行时的配置文件」纳入 Git 版本管理与 Code Review。