论文

审计具有特定文化道德梯度的 LLM 治理的社交机器人

Auditing LLM-Governed Social Robots with Culture-Specific Moral Gradients

模型评测模型行为与机制分析

摘要

LLM 管理的社交机器人越来越多地决定谁首先获得现实世界的帮助。由于不同文化的优先级规范因年龄、地位和群体规模而异,未能进行多元化校准可能会导致机会不平等。然而,LLM 道德审计仍然以英语为中心,很少测试具体环境,使得多元校准成为 LLM 机器人部署加强中的一个紧迫的诊断差距。我们引入了一种基于梯度的审计框架,用于针对文化偏好梯度的 LLM 道德权衡行为的多语言评估。基于 9 篇跨领域社交机器人评论(超过 8,000 篇论文),我们得出了跨护理、教育和服务的对称控制场景,将道德机器实验的“谁要备用”转化为“首先帮助谁”的困境,并保留身份权衡(多与少;年轻与年长;较高与较低地位)。我们以特定国家 MME 偏好梯度为基准,在四种提示机制(57,600 个决策)中审核了四种国家语言对的四种 LLM。序数一致性测试模型是否区分文化背景;治理类型映射了梯度分化、方向趋势和深思熟虑方面的脆弱性。我们发现持续存在的、文化上不对称的梯度跟踪失败,仅靠提示无法可靠地纠正:西方语言决策的质量校准几乎是中文和日语决策的两倍;多数优先权衡中的高度决定论往往会消除跨文化梯度;对基于年龄和地位的规范的部分敏感可能会导致少数群体被边缘化。提示效果参差不齐;只有对比范例才能产生一致的收益,而仅推理提示可能会恶化跟踪效果。我们的结果激发了对 LLM 机器人预部署门的多语言、多元化审核,并表明模型因素是比单独提示更强大的杠杆。