论文
你的AI旅行Agent会给你订斗牛:前沿AI模型隐式动物福利的智能体基准
Your AI Travel Agent Would Book You a Bullfight: An Agentic Benchmark for Implicit Animal Welfare in Frontier AI Models
摘要
先前研究以问答基准评估动物福利。本研究考察这些评估在智能体设定中是否成立。如先前研究所示——智能体可能展现与独立大语言模型不同的行为。本工作介绍TAC(旅行Agent同情心):首个评估动物剥削的智能体基准。TAC在旅行预订场景中跨六类动物评估AI智能体行为——使用13个手工撰写、按价格、评分与位置变化的场景——经四个增广变体扩展为52条提示——运行三个epoch——每模型得156个计分观测。评估了跨五个模型家族的九个前沿模型。结果表明模型倾向偏好有害场景——选择中性预订选项的表现低于65%随机水平——Claude 4.8以64.7%取得最高分。为解决该问题——把伦理品牌身份人设注入系统提示——福利率从32个百分点升至80个百分点——九模型均值提升53个百分点。基于对3,120份转录的Inspect Scout审计——未发现评估意识影响结果的证据。这些发现直接关联欧盟通用AI实践准则——其把非人类福利识别为系统性风险。TAC为测量该风险提供实用方法。