论文

还有什么需要修复?探索通过对话生成的工件中修订传播的经济有效的测试时间计算

What Else Needs Fixing? Exploring Cost-Effective Test-Time Compute for Revision Propagation in Artifacts Generated Through Conversation

模型评测基准与评测资源

摘要

大语言模型 (LLM) 通常帮助用户通过对话中的生成和修订的迭代循环来生成工件。这里的挑战是,当用户在修订期间仅指定本地更改时,LLM 必须识别相关依赖项并将修订传播到工件的所有受影响部分。本文研究了 LLM 在对话生成的工件上的这种能力,其中工件上下文及其依赖项可能嵌入在对话历史中。为了实际使用,我们还针对这种新设置探索具有成本效益的测试时间计算。具体来说,我们为此设置引入了一个新的基准,并在基准上使用 gpt-oss-20b/120b、gpt-5.4-mini 和 qwen3.5-9b/27b/122b 评估了九种修订方法,包括顺序反射和并行采样变体。结果表明,基线的准确率达到了 68.3--93%,最经济有效的方法是使用基于 LLM 的方法或中心点选择从三个平行样本中进行选择,这将准确率提高了 2.2--9.7%。我们的代码和数据集可在 https://github.com/ntt-dkiku/LLM-revision-propagation 获取。