论文

Agent-ValueBench:评估智能体价值观的综合基准

Agent-ValueBench: A Comprehensive Benchmark for Evaluating Agent Values

智能体系统Agent任务评测

摘要

自主智能体作为任务执行者已迅速成熟,并借助OpenClaw等运行框架得到广泛部署。安全问题理应受到日益增长的研究关注,而在这些问题之下,潜藏着暗中引导智能体行为的价值观。然而,现有价值观基准仍局限于LLM,智能体价值观在很大程度上仍是未测绘领域。从直觉、实证和理论三个视角,我们表明智能体的价值观与其底层LLM的价值观存在分歧,且智能体形态进一步引入了纯文本协议所没有的数据集级、评估级和系统级挑战。我们以Agent-ValueBench填补这一空白,这是首个专门面向智能体价值观的基准。它提供横跨16个领域的394个可执行环境,包含4,335个价值冲突任务,覆盖28个价值体系和332个维度。每个实例都通过我们专门构建的端到端流水线合成,并由专业心理学家逐例审核。每个任务都附有两条极性对齐的黄金轨迹,其检查点为基于量规的轨迹级评审提供锚定。我们对14个前沿专有与开源权重模型在4个主流运行框架上进行基准测试,得到三项相互印证的发现。智能体价值观首先表现为可解释逆流之下的跨模型同质化「价值潮」。这一潮汐在运行框架的牵引下非加性地偏移,而在通过嵌入技能刻意引导时偏移更为决定性。这些结果共同表明,智能体对齐的杠杆正从经典模型对齐和提示词引导转向运行框架对齐和技能引导。

Agent-ValueBench:评估智能体价值观的综合基准:论文配图
图1:同一GPT-5.4下LLM与智能体两种形态的价值观优先级对比及具体案例研究。