论文

CompanionBench:基于理论、基于现实世界的人工智能情感陪伴基准

CompanionBench: A Theory-Anchored, Real-World-Grounded Benchmark for AI Emotional Companionship

智能体系统Agent任务评测

摘要

LLM 同伴在对个人有重大影响的环境中大规模部署,但评估不力。现有的基准测试使用手工编写的场景和提示模拟器,将同理心汇总为一个分数,并忽略了法官的偏见,例如同族偏袒和量表漂移。我们推出 CompanionBench,一种交互式双语基准测试。据我们所知,它是第一个将其场景和训练有素的用户模拟器基于去识别化的现实世界数据的配套基准测试。隐藏的披露门根据代理自身的行为对每个角色的轨迹进行分支,无需编写对话脚本即可控制交互状态空间。我们运用了源自心理学和咨询领域 25 种理论的 10 种能力,其中四种能力没有被之前的工作明确分级:保持模糊性、自体客体反应、积极共鸣和校准挑战。智能体的评估有两个互补的轴:主观的十项能力标准和是否获得更深入披露的确定性衡量标准。跨家庭小组淡化了同家庭的偏袒;项目反应理论模型将代理质量与判断严重性分开。理论确定了要衡量的内容以及角色的构建方式;真实的数据提供事件、历史和概况——理论的覆盖性、数据的真实性。排名可以用两种语言重现(rho = 0.996 ZH / 0.953 EN)。对 28 名智能体的评估揭示了被总分掩盖的能力水平差异。情绪调节和校准挑战仍然是常见的弱点;持有歧义是最有歧视性的。角色扮演代理的排名接近底部:沉浸并不意味着关系能力。在代理中,主要的失败模式是用表面的热情取代实质性的关系支持。我们将发布500个汉英平行对和评估代码。