论文
可学习的企业数据理解:面向数据智能体的压缩与路由
Learned Enterprise Data Comprehension: Compression and Routing for Data Agents
摘要
企业环境中的结构化数据智能体必须对复杂数据环境进行推理,其相关证据分散在模式、关系、策略和反复出现的业务角色之中。现代智能体系统常通过可复用的 markdown 式记忆或技能文件来应对这一负担,把此前发现的信息保存下来供后续查询使用,减少重复发现同一结构的需要。这有用,但掩盖了一种自然的分工:智能体擅长语义推理,而学习系统擅长预测与组织反复出现的结构。我们提出潜在等价类学习(latent equivalence learning)来弥合这一鸿沟。该框架将持久的任务相关身份与其在数据集上的具体实现分离。在我们的实现中,支持与反对的证据塑造支持实现的高斯原型,学习这些身份在特定数据环境中的表达方式;软隶属画像则保留了硬分配下会丢失的区分。一个独立学习的查询-原型系统表示反复出现的证据需求,并通过学习到的兼容性函数映射到同一持久身份结构。这种按身份分解、按查询条件化的路由为下游推理具体化相关数据集证据,使智能体在已组织好的证据状态上运作,而无需在每次查询时重建跨模式结构。在覆盖 12 个异构数据集、54 个查询的 Data Agent Benchmark 上,我们的完整实现在五次完整试验中取得 94.67% 的数据集聚合分层 Pass@1,原始查询尝试 258/270 成功,而该基准的 Claude Opus 4.6 参照智能体为 55.51%;提交时在 40 个排行榜条目中排名第一。