论文
LLM 委派时损坏您的文档
LLMs Corrupt Your Documents When You Delegate
摘要
随着委托工作作为一种新的交互范式(例如,vibe 编码)的出现,大语言模型 (LLM) 有望颠覆知识工作。授权需要信任 - 期望 LLM 能够忠实地执行任务,而不会在文档中引入错误。我们引入 DELEGATE-52 来研究委托工作流程中人工智能系统的准备情况。 DELEGATE-52 模拟需要跨 52 个专业领域(例如编码、晶体学和乐谱)进行深入文档编辑的长期委派工作流程。我们对 19 LLM 进行的大规模实验表明,当前模型在委派过程中会降低文档的质量:即使是前沿模型(Gemini 3.1 Pro、Claude 4.6 Opus、GPT 5.4)在长工作流程结束时也会损坏平均 25% 的文档内容,而其他模型的故障更为严重。其他实验表明,代理工具的使用不会提高 DELEGATE-52 的性能,并且文档大小、交互长度或干扰文件的存在会加剧性能下降的严重性。我们的分析表明,当前的 LLM 是不可靠的代表:它们引入了稀疏但严重的错误,这些错误会默默地损坏文档,并在长时间的交互中加剧。