论文

你的提示词并非唯一提示词:LLM有多看重结构化输出的schema描述?

Your Prompt Is Not the Only Prompt: How Much Do LLMs Weight Structured-Output Schema Descriptions?

模型评测模型行为与机制分析

摘要

结构化输出——即LLM填充预定义JSON schema——已成为数据标注和信息提取的默认机制,但它也通过schema描述引入了第二条指令通道。我们用带随机造词标签的单字段分类任务,在来自两家厂商的十个模型配置上测试分类标签定义放在系统提示词、用户提示词还是schema描述中更优。schema描述并不稳定优于基于提示词的放置;对不开启推理的GPT-4.1和GPT-5.4,schema放置比系统提示词低11–13个百分点。但schema并非惰性元数据:当提示词与schema冲突时,错误的schema指令导致准确率下降5–45个百分点,Claude Haiku 4.5从52.5%跌至7%(表明schema指令可覆盖提示词指令),GPT-5.5从100%跌至73%。此外,在标签字段前加入一个必需的中间推理字段,在存在提升空间时将仅用schema的准确率提高15–24个百分点,在所有受测案例中均超过仅用系统提示词的表现。该效应在中等推理档位的Claude Sonnet 4.6上依然成立,而仅靠扩展思考并未产生可比增益。这表明schema设计会影响模型使用字段描述中信息的有效程度。总体而言,这些结果表明schema的影响依赖具体模型。实践中,系统提示词仍是放置定义的安全默认,但更重要的纪律是维护单一事实来源并防止提示词/schema漂移。更重要的是,schema设计本身可能是比指令放置更强的杠杆。从业者应将提示词与schema视为统一的指令面,并针对目标模型实证验证放置方式与字段设计。