论文

CaRL-EM:使用 LLM 进行实体匹配的成本感知强化学习

CaRL-EM: Cost-Aware Reinforcement Learning for Entity Matching with LLMs

模型训练强化学习

摘要

实体匹配 (EM) 需要细粒度的上下文理解和领域知识。最近的工作表明,大语言模型(LLM)可以作为跨域的强匹配器,但大多数方法要么做出独立的成对决策,要么依赖于手动设计的复合管道,因此在实际的多候选设置中缺乏灵活性。与此同时,他们通常会忽略大规模的推理成本。我们将基于 LLM 的 EM 与候选者制定为成本感知的顺序决策问题,并提出 CaRL-EM,这是一种管理 LLM 操作的强化学习控制器。给定锚记录的状态、候选集和成本,CaRL-EM 自适应地在不同的运算符(匹配/比较/选择/决策)和模型容量之间进行选择,以最大化质量成本目标。该策略与抽象运算符交互,允许在推理时将同一控制器与不同的底层 LLM 后端重用,而无需重新训练。 7 个基准测试的实验表明,CaRL-EM (i) 学会根据任务复杂性动态规划廉价和昂贵算子的使用,(ii) 在不同的数据集和域之间实现稳健的零样本传输,(iii) 始终实现比基于 LLM 的强大基线和手动设计的管道更好的质量成本权衡,从而在相当或更高的质量下产生更低的推理成本。