论文

知道何时不答:不可回答信号的跨域与多轮泛化

Knowing When Not to Answer: Cross-Domain and Multi-Turn Generalization of Latent Underspecification Signals

模型评测模型行为与机制分析

摘要

大语言模型通常会回答无法从所提供的信息中回答的问题,并且在对话中他们在说得足够多之前就回答了。不可回答性可以从隐藏状态线性解码,但尚不清楚其哪种形式共享表示以及信号在对话中是否有用。我们提供了一个回合标记的多回合基准(423 个对话,1,661 个标记的回合状态)和一个由回答澄清问题的模拟用户进行的评估 Harness,并将它们与六个数据集和六个 开放权重 LLM 一起使用,以测试 探针 的不可回答性进行了多远。 探针 在具有不可解答性的数据集之间进行稳健传输:数学中缺失信息 (AUROC 0.77-0.97) 和段落中的信息 (SQuAD 2.0<->MuSiQue, 0.77-0.90)。用于认知“已知-未知”的 探针 很难迁移到数学,但这种分离在词汇控制下减弱,并随层和坐标系变化,因此仍未解决。单轮 探针 无法零次检测对话何时可应答;结构内的 探针 可以恢复它,但并不比词袋分类器更好。校准后的 探针 上的门(不进行模型微调)在未指定的回合上的触发精度远高于 随机水平,并且其末端 任务成功率 与给定真实标签的门的误差在 0.08 以内。然而,在四种模型中,它并没有可靠地击败普通一代或促进整合。剩下的差距主要在于模型如何使用澄清,而不是检测。

知道何时不答:不可回答信号的跨域与多轮泛化:论文原图
图 1:四个 8-12B 模型(AUROC,种子平均值)的四个核心数据集上的 Train$\times$test 传输矩阵。所有六个数据集上的所有六个模型均在附录图 3 中。