论文

RPCBench:大语言模型推荐中主动前提批判的基准

RPCBench: A Benchmark for Proactive Premise Critique in LLM-based Recommendation

模型评测基准与评测资源

摘要

大语言模型越来越多地用作交互式推荐助手。因此,他们的评估应该超越合理的项目推荐,并测试他们是否能够识别有缺陷的推荐请求。现有的推荐基准主要评估排名、生成或偏好满意度,而现有的错误检测基准通常不基于推荐特定的用户和候选证据。为了弥补这一差距,我们引入了 RPCBench,这是一个评估推荐前提批判的基准:检测、诊断和正确处理自然语言推荐请求中错误前提的能力。 RPCBench 包含来自五个推荐领域的循证测试实例,涵盖十种类型的前提故障。每个实例都提供可见的推荐上下文和损坏的用户查询。我们进一步设计了一个细粒度的评估框架,用于衡量主动检测、错误定位、检测后处理策略和证据可信度。通过对 11 个LLM的系统评估,我们发现主动检测是推荐前提批判的主要瓶颈,并且模型在未指定前提错误上表现最差。我们还观察到,目标关键信息密度比冗余证据更重要,并且较长的推理并不能单调提高批评质量:中等推理长度时性能达到峰值,而过长的推理会伴随着过度思考的惩罚。代码可在 https://github.com/ZhongruChen/RPCBench 获取。

RPCBench:大语言模型推荐中主动前提批判的基准:论文配图
图2:基准建设管道和评估框架概述。