论文
PhantomFill:当表单需要答案时,语言模型会发明一个答案
PhantomFill: When the Form Demands an Answer, Language Models Invent One
摘要
生产中的语言模型不会写散文。它们填写表单:JSON 字段、函数参数、提取模板。我们证明这种形式本身会引起幻觉。我们向十三个模型询问关于相同输入的相同问题,并且仅更改答案格式。输入的构建是为了让问题无法得到回答:一篇病毒式帖子显示 12,400 个点赞,但没有可见的回复,一张支持票的电话从未被转录。在自由文本中,GPT-5.5 表示 98% 的情况下没有回复数据。给定情感所需的 JSON 字段,同一模型在 40 次中发明了 40 次答案。它捏造了它从未见过的人群的情绪,并引用了它从未听说过的客户。所需字段将 13 个模型中的 10 个模型的制造率提高到 100%。明确的“证据不足”选项只能拯救边界:所有九个开放权重模型都忽略它。在语法约束解码下,保证采样器可以访问转义词元,五个开放模型在进行制造的三个字段上的 203 次试验中花费了零次,在转义不承认任何内容的一个字段上花费了 12 次。他们可以发出这个词。他们拒绝把钱花在需要他们得到答案的地方。直接指令(不推断情绪)被六个模型中的四个模型所覆盖。阻力并不随规模而来:在单一模型系列中,最小的模型拒绝,中型模型制造,最大的模型再次拒绝。格式压力下的诚实是一种没有人衡量的训练结果。制造隐藏在不可能对冲的地方:在必需的枚举和最小计数数组中,以及不适合免责声明的字段。我们发布了 PhantomFill,这是一个具有确定性评分和两个可报告数字的基准:强制制造率和逃逸利用率。我们测试的修复是一行模式。我们衡量的失败无处不在。