论文

行动时刻的自信:隐藏信息下LLM对局的信念失校准

Confident at the moment of action: belief miscalibration in LLM play under hidden information

模型评测鲁棒性、公平性与可信度评测

摘要

Agentic系统越来越多地依据模型自述的置信度来决定是否执行动作,这一做法假设置信度在行动时刻与正确性相符。我们在一个隐藏信息国际象棋变体中检验这一点:王的身份可以在棋子之间被秘密地、反复地重新安置,而智能体对对手隐藏王所在棋子的自述概率分布——每回合单独引出,独立于它所选择的走法——与对局结束后可恢复的真值进行比对打分。在两个独立批次中,在自述对隐藏棋子位置高置信度(≥0.5)时发动的吃子,62例中只有1例正确。校准赤字几乎完全集中在这些事件上:原始批次占99.3%,复现批次占98.7%。同一模式以更弱的形式、一致的排序出现在跨越第二家供应商的另外四个模型配置中(仅为点估计;在此样本量下大多数两两差距在统计上不可区分)——报告这一点的目的是界定发现的适用范围,而非作为能力预测校准的证据:在固定外部排行榜得分的同模型比较中,仅改变思考预算就能使该指标移动接近大型跨模型差距的幅度。在另一组设置中,常规评估轴——合法性、成本、延迟、完成率——可以与信念质量完全解耦,在所有常规轴上获胜的配置产生了测试中最差的信念质量。表现出这种模式的模型仍能赢得其信念所涉及的对局,这正是仅看结果的评估无法检测到它的原因。

行动时刻的自信:隐藏信息下LLM对局的信念失校准:论文配图
图1:可靠性图:采集时所述置信度与命中率的关系,合并两个已评分批次(n=394个仅采集事件),并附修正后参考跟踪器曲线。标记面积与该箱n成正比;不在空箱之间连线。引用于§4.1。