论文

用于诊断推理模型中未知未知的结构化无知证书的校准

Calibration of Structured Ignorance Certificates for Diagnosing Unknown Unknowns in Reasoning Models

模型训练强化学习

摘要

大语言模型 经常以一种典型的方式失败:他们不是承认自己无知,而是对超出其知识范围的问题给出流畅但不正确的答案。我们引入了 \textbf{结构化无知证书} (SIC),这是一种 JSON 格式的输出模式,它要求模型显式命名缺失的域交集,枚举所需的概念,并提出高效的检索查询,而不是幻觉答案。为了训练模型产生高质量的 SIC,我们构建了一个 7,347 个样本 \emph{Unknown-Unknown} (UU) 数据集,方法是提示 Qwen3-14B 将来自七个领域(物理、生物、工程、计算机科学、经济学、医学、法律)的问题拼接成单领域专家无法回答的新颖的跨领域查询。我们使用结合了检索效用、概念特异性和输出格式有效性的复合奖励,通过组相对策略优化 (GRPO) 微调 14B 参数模型。对模型响应进行训练的释义分歧探针证实,SIC 调整的输出系统地表现出更高的未知-未知概率得分。对 735 个保留的 UU 问题的评估实现了 99.46% JSON 有效性,平均证书特异性得分为 0.967,并且在基于检索的生成上比基本模型提高了 3.6% ROUGE-L - 证明显式认知结构是一种可学习和可测量的能力。