论文
正确答案存在仍可能选错:显式验证的独立作用
Knowing Is Not Choosing: What Explicit Verification Adds Beyond Generative Preference
摘要
生成正确答案并不意味着语言模型会选择它。我们将事实回忆分为三个步骤:生成正确的候选者、对可用候选者进行排名以及选择最终答案。预生成读数预测事实回忆以及抽样将涵盖三个模型系列的哪些问题,但很少提及是否最终会选择可用的正确答案。使用 $P(True)$ 的显式验证提高了 Gemma、Qwen3 和 Llama 中平均对数似然的问题内排名,AUROC 收益为 $0.08$--$0.12$。在前瞻性定义的 Gemma 队列中,验证将复数准确性提高了约 5 美元点,并且仍然比聊天模板可能性(更强的生成基线)获得约 2 美元点。对于具有共同答案先验的关系,优势最强,并且取决于对实体的访问;掩盖实体会消除较大 Qwen 模型中的排名优势。最后,衡量的好处取决于如何定义正确性:面向回忆的参考匹配可以信任可能性所青睐的选项列表,并大大低估了人类语义判断下所看到的改进。