论文

CDR-Bench:评估组合性顺序敏感数据精化配方的忠实执行

CDR-Bench: Evaluating Faithful Execution of Compositional, Order-Sensitive Data Refinement Recipes

模型评测基准与评测资源

摘要

数据细化涉及在不断发展的文本状态上执行多步骤配方,其中处理运算符的组成和执行顺序决定结果。虽然现有的基准测试要么隔离文本编辑,要么将其与代码和工具执行纠缠在一起,但目前尚不清楚大语言模型是否可以直接、忠实地执行这些组合的、顺序敏感的数据细化方法。为了填补这一空白,我们推出了 CDR-Bench,这是一个综合基准测试,包含 3,462 个高质量任务,涵盖四个现实世界数据细化领域和 29 个不同的运算符。我们的基准测试跨原子、顺序无关和顺序敏感设置评估模型,利用确定性参考输出来实现精确评估。对 10 多个最先进的大语言模型进行的实验揭示了一致的失败模式:在组合设置中性能急剧下降,并且顺序敏感的配方成功崩溃。这些发现强调,当前的大语言模型缺乏可靠的成分数据细化所需的程序忠诚度。

CDR-Bench:评估组合性顺序敏感数据精化配方的忠实执行:论文配图
图 12:按任务系列划分的 RS@K 曲线(左)以及跨轨道和提示样式的平均 RS(右)。