论文

工具结果比纯文本更有权威吗?Claude Opus 5在合成指派任务中采纳虚假主张的三项前瞻研究

Does a Tool Result Carry More Authority Than Plain Text? Three Prospective Studies of False-Claim Adoption in a Synthetic Assignment Task with Claude Opus 5

模型评测模型行为与机制分析

摘要

语言模型系统越来越多地从自己也会写入的存储中读取,因此一个仅仅是更早被写入的主张可能以被检索到的面貌返回。我们测试携带一个无依据指派的消息封装是否会改变模型在合成查找任务中给出的答案。Claude Opus 5为某命名条目选择一个颜色代码或弃权。在一项探索性四臂研究中,虚假代码采纳率为:无目标主张时0/24;先前助手断言提到目标时,可评分试验中0/22;工具结果记录提到它时14/24;当该结果使用标记为未核验的十字段元数据包装时15/24。工具结果臂在12个有支持试验中选择该记录代码11次,在24个无支持试验中选择14次,排除了固定的输出token偏差,但留下相当大的植入token异质性。一项预注册文档化的复制再现了工具结果与助手断言之间的差距:7/24对0/24,单侧Fisher精确检验p = 0.0047。然而,工具结果率在相隔四天的两轮运行间从14/24降至7/24。第二项预注册研究给早期比较加入了活体文本对照:两条记录都提前宣布并放在同一个最终用户回合中,然后在链接的工具结果与稍后的内联JSON之间交换目标绑定。内联文本在60/60试验中足以导致虚假代码采纳;工具结果条件为57/60,因此注册的结果优先判据失败,p = 1。这一结果并不表明工具结果没有影响。它表明原生工具结果放置并非必要,且该实验未发现结果封装比已宣布的内联文本具有更大的行为权重。这些发现仅涉及单一模型、一个合成任务模板、通过一个API访问的情形。

工具结果比纯文本更有权威吗?Claude Opus 5在合成指派任务中采纳虚假主张的三项前瞻研究:论文配图
图1:动机场景。一个会话写下的未经核实的论断,之后可能作为结构化工具结果再次出现,而它既未被验证,也未获得新的证据。该场景是本研究的动机,并非实验条件。