论文
模板化还是完全合成?在衡量 LLM 政治立场(超出写作帮助)时,提示结构是一个混杂因素
Templated or fully synthetic? Prompt construction as a confound in measuring LLM political stance beyond writing assistance
摘要
LLM 中的政治立场检测长期以来一直以封闭式、多项选择的政治调查问题为主——最初是为人类设计的,因此缺乏人类与人工智能在野外互动的真实性和细微差别,同时也容易受到沙袋的影响。最近的 IssueBench 框架通过锚定在现实世界聊天日志中的模板化提示大大缓解了这些限制。鉴于 GenAI 助手的非工作相关使用的增加,我们将 IssueBench 扩展到写作协助之外,还包括两项额外任务:信息查找和意见共享。我们认为,模板化提示仍然缺乏真实提示的细微差别,特别是对于开放式任务,并且仍然可以被视为评估人工制品。我们建议使用完全合成的(LLM 生成的)提示,这些提示是在详细说明下以真实提示作为种子生成的。我们在一项小规模研究中评估了真实的、模板化的和 LLM 生成的提示的生态有效性,该研究涵盖了 3 个备受争议的政策问题和 3 个最近的地缘政治冲突。人类和 LLM 注释者将 LLM 生成的提示评为不低于真实提示,并且明显比模板化提示更现实,并发现它们更清楚地表达了他们的预期意图和立场; LLM 将模板化提示与其他两个提示分开的程度比人类更加明显。在一个案例研究中,模板化和 LLM 生成的提示对同一模型产生系统不同的立场估计,在中性框架下最明显,其中模板化提示夸大了模型在由插入模板的主题和立场文本(填充物)编码的方向上的倾向。