论文

不是什么,而是如何:一个用于审核 LLM 跨定位、泛化、拟人化和格言响应的框架

Not What, But How: A Framework for Auditing LLM Responses across Positioning, Generalization, Anthropomorphism, and Maxims

模型评测评测方法与指标

摘要

大语言模型 (LLM) 越来越多地用于回答主观的、寻求信息的问题,其中用户对响应的传达方式很敏感,而不仅仅是答案是否正确。现有的 LLM 对主观文化查询的评估主要关注事实的正确性,而忽略了响应的框架。为此,我们引入了 FRANZ,一个用于响应表征的自动化框架,用于从四个维度对 LLM 响应进行交际审核:文化定位、泛化语言的使用、拟人化线索以及对对话准则的遵守。为了实现这一评估,我们贡献了 SQUARE——一个包含 376,000 个主观问题的语料库,来自 57 个 Reddit 子版块,映射到 7 个国家和 19 个问题类别。我们通过对三个开放权重 LLM 的响应进行评分来证明 FRANZ 的适用性。我们观察到,LLM 在使用每种响应特征的频率上表现出统计上的显着差异。与单维度审计不同,FRANZ 揭示了内部人定位和拟人化是正耦合的,耦合程度因国家/地区而异,为识别框架分歧提供了诊断镜头。