论文

规范预言机

Specification Oracles

模型评测模型能力评测

摘要

规格面临着一个基本的权衡:遗漏细节,重要的问题得不到解答;单独记录每一个细节,说明书就变得庞大而冗长。我们通过学习有关目标的事实并直接回答有关它的问题来研究语言模型是否可以充当紧凑的、生动的规范预言机。我们比较了两种存储学到的事实的方法:外部文本注释和模型权重的更改。在 596 个事实世界的四个系列和两个 Qwen2.5 模型大小中,仅权重预言机从结构中受益更多:使用 7B 模型,其跨存储容量的集成准确度在结构化世界上比非结构化世界高 18.5 个百分点,而笔记表预言机仅高 1.1 个百分点。这一优势的代价是巨大的存储成本,最小的适配器大约需要 175 KiB,而最大的笔记本预算为 16 KiB。因此,调整后的权重可以更成功地利用潜在结构,而外部注释所需的特定于对象的存储要少得多。