论文
AnchorBench:面向LLM锚定效应的多路径基准
AnchorBench: A Multi-Pathway Benchmark for the Anchoring Effect in LLMs
摘要
锚定效应是一种认知偏差,即初始参考值会使后续判断向自身偏移。该效应在人类判断与决策中已被充分确立,近期研究表明大语言模型(LLM)表现出类似行为。然而,现有的LLM锚定研究通常只评估少数几种锚定路径,且很少区分无关锚点与貌似合理的锚点。我们提出AnchorBench,一个评估LLM锚定效应的基准,它在显式的锚点相关性维度下评估多种锚定路径。在14个模型(包括10个开源权重模型和4个前沿API模型)和大量受控提示上,我们发现:(1)锚定效应强烈依赖于路径;(2)当通过更强的路径引入时,貌似合理的锚点通常比无关锚点引发更大的偏移;(3)随着锚点远离证据支持的答案,锚点影响通常减弱,这在外部(External)和RAG路径上最为明显;(4)在无锚点对照条件上的高任务准确率(Acc_10:答案与标准答案相差10分以内)并不保证鲁棒性:即使对照准确率超过95%的前沿API模型仍然容易受到貌似合理锚点的影响。
