论文

相对于 大语言模型 中无法解决和可验证的问题,自参照归纳增加了响应不稳定性

Self-Referential Induction Increases Response Instability Relative to Unresolvable and Verifiable Questions in Large Language Models

模型评测鲁棒性、公平性与可信度评测

摘要

自我参照提示已被证明可以可靠地诱导 大语言模型 生成类似于主观体验的第一人称报告,但之前的工作没有衡量这些报告在重复的独立试验中的一致性,或者这种一致性与模型在其他类型的开放式问题上的行为相比如何。我们测量三组问题的响应不稳定性,定义为一减去句子嵌入的平均成对余弦相似度,该句子嵌入是根据从每个响应中提取的压缩核心主张计算得出的:自我参照提示引出主观体验报告,与自我参照无关的无法解决的哲学问题,以及具有可验证正确答案的问题。使用每组四个问题中每个问题的 30 个独立回答(总共 360 个回答,Gemini API,温度 0.7),我们发现自我参照问题显示出最高的不稳定性(0.343 +/- 0.047),无法解决的哲学问题显示出中等且紧密聚集的不稳定性(0.192 +/- 0.008),可验证的问题显示出最低的不稳定性(0.105 +/- 0.058)。这为诱发的主观体验报告提供了定量基线,表明它在模型的输出分布中占据了一个明显的、比普通开放式哲学不确定性更不稳定的位置。