论文
大语言模型何时应弃权?用于选择性风险控制的自我质疑链
When Should LLMs Abstain? Chain-of-Self-Questioning for Selective Risk Control
摘要
当事实支持较弱时,大型语言模型可以产生流畅的答案。本文介绍了自问链(CoSQ),这是一种仅提示的框架,它使答案承诺以对回答问题所需信息的明确评估为条件。我们使用 11 个开放权重和托管模型系列,在 817 项 TruthfulQA 多项选择验证集上的 17 个条件下评估了三个 CoSQ 变体。在最终的平衡选项协议中,τ=0.90的Grounded-CoSQ将思想链提示下的平均无条件错误承诺率从13.1%降低到8.9%,相对降低了32.1%,同时将回答准确性从86.9%提高到89.7%,回答了87.6%的问题。这两项改进适用于所有十一个模型以及每个评估的阈值。 Critical-CoSQ 和 Adaptive-CoSQ 分别为相邻操作点提供 88.6% 和 86.5% 的覆盖率,同时比基线更可靠。二次自然问题简答评估提供了收敛的开放式证据。这些发现表明,当不受支持的承诺比转介或审查的成本更高时,自我评估可以支持明确的、可调整的回答或弃权决定。