论文

通过扎根多轮社交模拟在 LLM 中审计支持策略

Auditing Support Strategies in LLMs through Grounded Multi-Turn Social Simulation

模型评测模型行为与机制分析

摘要

当用户向聊天机器人寻求社交支持时,他们会逐渐透露自己的情况,但大多数对支持性 LLM 的评估依赖于单轮、完全指定的提示。我们引入了一个多回合仿真框架来弥补这一差距。来自五个 Reddit 社区的寻求支持的叙述被分解为有序的片段,并轮流显示为语言模型。每个响应都使用社会支持行为代码 (SSBC) 进行编码,这是一种既定的多标签分类法,可捕获支持的构成,而不是单一的质量得分。为了询问支持选择是否跟踪模型自身对用户痛苦的解释,我们对隐藏表示使用线性探针来估计这个内部信号,而不改变生成上下文。在两个中型模型(Llama-3.1-8B、OLMo-3-7B)和超过 6,200 个回合中,支持构成随着估计的痛苦而系统性地变化:随着估计的痛苦的增加,教学能力下降,这一发现在各个架构中重复,而情感和尊重导向策略(例如验证)的增加是有暗示性的,但特定于模型,并且依赖于更嘈杂的注释。社区环境独立地塑造行为,跟踪主题和话语规范,而不是人口统计类别。这些轨迹级动态对于单轮评估来说是不可见的,但却激发了社会敏感应用程序的多轮审核框架。