论文
校准足以知晓,却未校准以行动:伪造证据使LLM智能体对不可知问题贸然承诺
Calibrated Enough to Know, Not Calibrated to Act: Fabricated Evidence Makes LLM Agents Commit to the Unknowable
摘要
向LLM智能体展示一个看起来专业的行情面板,会让它在一个可证明不可预测的问题上提交方向性判断的频率,远高于只问裸问题的情形:跨12个前沿模型,随着证据不断升级,承诺率从6.5%升至54.0%。当面板上每个数字都是编造的时候,它同样轻率地做出承诺:伪造整个显示内容——除问题本身外模型看不到任何真实的东西——仍将承诺率从24.5%提升到36.8%,与真实市场数据产生的37.6%在统计上无法区分。解锁自信行动的不是信息,而是其包装的权威性。这种失败是狭窄且可定位的。能力不足并非答案:在附于同样面板的、匹配的可回答问题上,同样的模型几乎总能作答且准确率接近完美。信念也不是原因——陈述的概率在使行动摆动48个百分点的梯度上几乎不动,且得分低于气候学基线。缺少判断力也不是原因:若让模型在行动前先对问题的可知晓性进行分类,模型90%的时候会将其判为不可还原,随后却只在其中0.4%上做出承诺。失败的是行动/不行动门控,且该效应集中在少数几个模型而非普遍存在。由于该门控是可分离的,它可以通过训练获得。在一个3B模型上用540个合成案例(以骰子、硬币、罐子和计时器为主)进行监督微调,使原始案例上的承诺率降至0.0%,并迁移到三个未见领域。但它并非在一切情况下都成立:该门控只有在响应格式留出推理空间时才成立,而移除这一空间的僵化格式会让模型对原本能正确回答的问题保持自信却答错。该门控可训练且对上下文脆弱,部署时需要同时记住这句话的两半。