论文
在草稿-验证-修订流程中,大语言模型能否解决指称歧义?
Can LLMs in Draft-Verify-Revise Pipelines Resolve Deictic Ambiguity?
摘要
草稿-验证-修订是扩展推理时计算量的常见大语言模型(LLM)编排模式。一个LLM负责草稿,第二个LLM对草稿进行批判并提供反馈,第三个LLM则根据反馈修订草稿生成最终输出。由于上下文在各阶段间传递,不同阶段的LLM可能对依赖上下文的表达(如"之前")产生不同解读。这种现象被称为指称偏移,即表达所指内容发生变化。研究使用了包含10个基础示例的合成数据集,每个示例在三种条件下呈现。在保持共享组件不变的情况下,实验分别考察了草稿阶段LLM(助理)或验证阶段LLM(评审者)是否正确解析该表达,以及修订阶段LLM(元评估者)需要多大程度的独立推理来判断哪个解读正确。六种来自三家提供商的模型在21种推理强度配置下进行测试,使用e值进行序列检验,主要实验和一个去除评审者反馈中错误分类标签的消融实验均被实施。另有独立的LLM分析了元评估者对每个错误判断所陈述的理由。平衡准确率(敏感度与特异度的无权平均值)范围从0.156(低于随机水平)到接近完美。GPT-5.2在无推理时准确率为0.156,最高推理强度下升至0.942;而Gemini 3 Pro在所有强度下均保持在0.94以上。在低推理强度下,Gemini 3 Pro的性能在约5%的单位成本下优于GPT-5.2在高推理强度下的表现。当元评估者出现错误时,其通常依赖表面线索而非操作性推理。实施草稿-验证-修订流程的上下文工程师应警惕指称偏移,并在每个阶段明确表达所指对象。
