论文

人类的参照不确定性--人工智能协作

Referential Uncertainty in Human--AI Collaboration

模型评测鲁棒性、公平性与可信度评测

摘要

有效的人类与人工智能协作需要合作伙伴通过交互建立参考,当描述不明确、相似的参考对象竞争或合作伙伴看到不同的事物时,这种协作就会变得脆弱。我们研究了指称不确定性——描述所指的候选对象的不确定性——在一项协作拼图任务中,其中人类助手指示人工智能工作者放置棋子。工人必须识别并传达其不确定性,而帮助者必须识别并采取行动。我们表明,与严重过度自信的原始动作标记概率(平均置信度为 0.97,ECE 0.44)相比,单独引出的候选片段信念分布可以更好地校准(ECE 0.15),并且可以更好地区分正确位置和错误位置(AUROC 0.65)。在三种前沿视觉语言模型(GPT-4.1、GPT-5、GPT-5.5)中,这种不确定性会随着指令的模糊性而增加,但不会随着上下文中的竞争指称而增加,即使这些会增加错误。模型很少将其具体化,仅要求对 3.5-16.7% 的转弯进行澄清。在一项对照人类研究 (N=210) 中,仅给予 Worker 默认消息的参与者接受 78% 的错误放置,并且无法辨别对错 (AUC 0.50)。精确的描述,尤其是针对性强的对冲,将错误行动的接受度降低到 36%,同时在很大程度上保留了正确行动的接受度,弥补了共享意识的缺失,例如看不到工人的行动。但这种好处取决于目标:源自模型自身信念熵的可部署对冲继承了该信号的弱点,并且弊大于利。外部化的不确定性只有在准确定位时才能对人类合作伙伴有所帮助。