论文

ProactBench:超越用户的要求

ProactBench: Beyond What The User Asked For

模型评测基准与评测资源

摘要

大多数 LLM 基准测试都会对模型响应显式请求的情况进行评分。他们留下了一种无法衡量的不同的对话能力:注意到用户暗示但未说出的需求并采取行动。我们称之为\emph{会话主动性}。 ProactBench 将其分解为三个阶段相关的类型: \textsc{Emergent},从单个公开的锚点推断; \textsc{Critical},跨多个锚点的合成;和 \textsc{Recovery},任务完成后的有依据的后续建议价值。我们使用三个代理来操作基准:规划器、用户代理和助理模型。他们的信息不对称可以防止风格混乱的评分、标题泄漏、外部上下文污染和信息转储。发布的语料库包含 198 个精心策划的对话,涉及 24 种沟通方式的 624 个触发点,这些对话来自心理测量清单,并由独立的 LLM 法官进行审核。在 16 个前沿和开放权重模型中,\textsc{Recovery} 被六个标准基准预测得既困难又弱,这使其成为一个有用的新评估信号。