论文

模型回忆起他们违反的内容:多轮 LLM 构想中的约束遵守

Models Recall What They Violate: Constraint Adherence in Multi-Turn LLM Ideation

模型评测基准与评测资源

摘要

当研究人员使用 大语言模型 迭代地完善想法时,模型是否保持对原始目标的保真度?我们引入了 DriftBench,它是评估多轮 LLM 辅助科学构思中约束遵守情况的基准。通过 2,146 次评分基准运行,涵盖来自 5 个提供商的 7 个模型(包括 2 个开放权重)、4 个交互条件以及来自 24 个科学领域的 38 个研究摘要,我们发现迭代压力可靠地增加了结构复杂性,并且通常会降低对原始约束的遵守。重述探针揭示了声明性回忆和行为依从性之间的分离,因为模型准确地重述了它们同时违反的约束。尽管保留了召回率,但衡量约束不遵守情况的“知道但违反”(KBV) 率在各个模型中的范围为 8% 到 99%。结构化检查点部分降低了 KBV 率,但并没有消除分离,并且复杂性膨胀仍然存在。针对盲评者的人工验证证实,LLM 法官未能充分检测到约束违规行为,从而使报告的约束遵守分数变得保守。敏感性分析证实研究结果对于温度(0.7 vs.\ 1.0)和压力类型(新颖性与\严格性)是稳健的。我们发布所有简报、提示、评分标准、成绩单和分数作为开放基准。