论文

土耳其语源敏感推理基准测试:证据信任操纵下的人类和 LLM

Benchmarking Source-Sensitive Reasoning in Turkish: Humans and LLMs under Evidential Trust Manipulation

模型评测模型能力评测

摘要

本文研究了来源可信度是否塑造了土耳其语证据形态,以及 大语言模型 (LLM) 是否跟踪这种敏感性。我们研究了受控完形填空上下文中 -DI 和 -mIs 之间的过去域对比,其中信息源明显是外部的,而只有其感知的可靠性受到操纵(高信任与低信任)。在人类生产实验中,土耳其语母语者表现出强大的信任效应:高信任上下文产生相对更多的 -DI,而低信任上下文产生相对更多的 -mIs,并且该模式在敏感性分析中保持稳定。然后,我们在三种提示范式(开放式间隙填充、显式过去时间隙填充和强制选择 A/B 选择)中评估 10 LLM。 LLM 行为高度依赖于模型和提示:一些模型显示出较弱或局部信任一致的变化,但效果通常不稳定,经常逆转,并且经常被输出合规性问题和强大的基本速率后缀偏好所掩盖。结果为基于信任/承诺的土耳其证据性解释提供了新的证据,并揭示了源敏感证据推理中明显的人类-LLM 差距。