论文

我们能驾驭黑匣子吗?使用协作代理对推荐系统进行以可控性为中心的评估

Can We Steer the Black-Box? Towards Controllability-Centric Evaluation of Recommender Systems with Collaborative Agents

模型评测评测方法与指标

摘要

推荐系统作为黑匣子运行,使用户和监管机构无法引导其输出达到特定意图或审核其行为。这种缺乏可控性(定义为系统响应明确指导的能力)仍然是现有评估范式中未解决的问题。为了填补这一空白,我们提出了 CtrlBench-Rec,一个用于系统评估可控性的协作多智能体框架。我们形式化了三个基本任务:目标内容发现、兴趣概况塑造和流行偏差缓解,它们共同衡量从显式命令到隐式表示转向,最后到克服算法偏差的可操纵性。对现实世界数据集和多个推荐模型的大量实验表明,我们的框架有效地量化了可控性并暴露了关键的系统瓶颈,最明显的是对引导长尾内容的持续阻力。 CtrlBench-Rec 为可控推荐研究、算法审计和用户赋能提供了第一个标准化工具包。我们的代码发布在 https://github.com/caskcsg/CtrlBenchRec 上。