论文

约束引导的大语言模型企业数据映射

Constraint-Guided Enterprise Data Mapping with Large Language Models

摘要

企业实体对齐必须处理半结构化记录、隐式属性以及单位或粒度不匹配。人工匹配在实践中仍然普遍,但随着模式和提供方的演进而无法扩展。仅用LLM的匹配提升了语义召回,却可能违反结构和物理不变量,产生流畅但操作上无效的对应关系。我们提出约束引导映射(CGM),一种三阶段的神经符号方法:(i) 基于模式的可采性约束及元数据 mc = <tau_c, delta_c>,其中tau_c表示约束类型,delta_c提供可执行的关系与规范化逻辑;(ii) 带级联松弛的约束受限候选生成,以在噪声下保证非空可行集;(iii) 限于该可行集的神经排序与有界LLM消歧。在方法论上,约束作为假设空间算子而非事后验证器运行,实现松弛下的可控退化以及可审计、可由人引导的决策。在一个受控结构诱饵基准上,硬可采性在不丢失真值(GT)的情况下将候选空间缩小约480倍,逐层消融显示决定性提升来自这道门而非LLM(F1从0.08到0.66)。该收益与模型无关且不增加额外推理成本:带约束的小模型在约低28倍的成本下匹敌不带约束的前沿LLM。可迁移的是方法本身而非某个调优配置:跨七家企业数据(宏F1 0.70),每家使用其各自自动发现、可由专家精修的约束,相比电子表格流程将专家工作量降低约7倍。公开的Valentine结果提供了外部排序合理性检查并标出了边界:约束应仅在结构不变量决定匹配成败之处采用硬约束。