论文

使用LLM智能体跨文化模拟公民对官僚繁文缛节的情绪反应

Cross-Cultural Simulation of Citizen Emotional Responses to Bureaucratic Red Tape Using LLM Agents

模型评测鲁棒性、公平性与可信度评测

摘要

改进政策制定是公共行政的核心关切。以往的人类被试研究揭示了政策实施过程中公民对繁文缛节(red tape)情绪反应的显著跨文化差异。尽管LLM智能体为模拟类人反应并降低实验成本提供了机会,其生成对繁文缛节符合文化语境的情绪反应的能力仍未得到验证。为填补这一空白,我们提出一个评估框架,用于衡量LLM在不同文化语境下对繁文缛节的情绪反应。作为试点研究,我们将该框架应用于单一繁文缛节场景。结果显示,所有模型与人类情绪反应的对齐都很有限,在东方文化中表现明显更弱。文化提示策略在改善对齐方面基本无效。我们进一步提出RAMO,一个用于模拟公民对繁文缛节的情绪反应并收集人类数据以改进模型的交互界面。该界面已在 https://ramo-chi.ivia.ch 公开可用。

使用LLM智能体跨文化模拟公民对官僚繁文缛节的情绪反应:论文配图
图 1. RAMO 界面设计概述,第 5 节详细介绍。主要组件被放大以方便查看,并用圆圈字母标记以供参考。该界面专为政策制定者设计,以模拟对跨文化的各种繁文缛节场景的潜在情绪反应。