论文
CompliBench:对话系统中合规性违规检测的 LLM 法官基准测试
CompliBench: Benchmarking LLM Judges for Compliance Violation Detection in Dialogue Systems
摘要
随着 大语言模型 (LLM) 越来越多地在企业环境中部署为面向任务的代理,确保它们严格遵守复杂的、特定于域的操作准则至关重要。虽然利用 LLM 作为法官是一种有前景的可扩展评估解决方案,但这些法官在检测特定政策违规行为方面的可靠性在很大程度上仍未得到探索。这一差距主要是由于缺乏系统的数据生成方法,而细粒度人工注释的巨大成本和合成现实代理违规行为的难度阻碍了这一方法的发展。在本文中,我们介绍了 CompliBench,这是一种新颖的基准测试,旨在评估 LLM 法官在多轮对话中检测和定位违反准则的能力。为了克服数据稀缺的问题,我们开发了一个可扩展的自动化数据生成管道来模拟用户代理交互。我们的可控缺陷注入过程会自动为违反准则和准确的对话生成精确的 真值 标签,而对抗性搜索方法则确保这些引入的扰动具有高度挑战性。我们的综合评估表明,当前最先进的专有 LLM 在这项任务上表现不佳。此外,我们证明了在我们的合成数据上进行微调的小规模判断模型优于领先的 LLM,并且可以很好地推广到未见过的业务领域,强调我们的管道是训练强大的生成奖励模型的有效基础。