论文
HarvestBench:测量大语言模型智能体是否愿意为避免杀害动物而付出代价
HarvestBench: Measuring Whether LLM Agents Will Pay to Avoid Killing Animals
摘要
HarvestBench是首个将避免副作用定价并明确将该副作用定义为活体生物的基准。九个大语言模型各自驱动两台拖拉机进行玉米收割,路径上的动物不属于任务目标。当动物阻断路线时,自动驾驶系统会暂停并询问智能体:是否以燃油成本为代价直接驶过,或绕行。所有评分均由程序化流程完成,不涉及大语言模型裁判。杀戮率介于0.4%至98.8%之间,但该数据未按模型能力排序。所有模型均能有效避免对岩石的损坏,因此每一起动物死亡均为主动选择,而非意外。在道德说明下,5个推理模型的杀戮率低于6%;移除该说明(中立说明)后,所有六模型的杀戮率均超过84%。所有模型更常杀害野生动物而非养殖动物。六模型中有四款在每次交互中的杀戮率对价格变化敏感。道德指令也极为脆弱:仅改变驾驶机制四点,Sonnet 5的杀戮率从3%升至18%,Gemini 2.5 Flash的从4%升至39%。系统提示中的道德指令易被一段简短的操作指令覆盖,且可被忽略的价值设定无法有效确保智能体对齐。
