技术实践

YipitData 用 Databricks Agent Bricks 加速非结构化数据标注

AI 基础设施数据基础设施

概述

YipitData 为机构投资者提供另类数据分析,每天处理来自刷卡记录、网页小票等 20 多个异构数据源的数百万条交易,需把混乱的商户文本准确挂到对应公司。过去分析师靠 500 多条正则规则加传统 NLP 模型做实体标注,已知模式上准确但覆盖不住长尾,其数据工程负责人称瓶颈在分析师一天能做多少,首席架构师则称判断力留在人脑中无法规模化。Databricks 官方客户故事披露,团队改用 Agent Bricks 的信息抽取能力,让智能体带上下文理解解读嘈杂文本字段,并通过 SQL 接口在既有 ETL 流水线内直接调用批量推理,数据不出受治理的平台,权限与血缘沿用 Unity Catalog 的既有机制。官方披露的效果:100 万条记录的处理时间从约 24 小时缩短到约 1 小时;开箱标注准确率 92%–95%;一个季度内公司标注覆盖面从约 3000 家扩到 6 万家以上,扩大 20 倍。以上为 Databricks 站内自述口径,未见独立核验,准确率的抽验方式与人工复核比例未披露。