论文

死文本还是有效条款?黑盒大语言模型对话中约束影响的测量与修复

Dead text or binding clause? Measuring and restoring constraint influence in black-box LLM dialogues

上下文与知识上下文工程记忆Agent记忆

摘要

多轮对话让用户撤销约束与施加约束同样容易,但撤销并不可靠地生效:模型会继续执行已被撤回的要求(有时还藏在声称已删除该要求的注释之下),这种失败我们称为行为复发(behavioral relapse)或撤销惰性。目前没有任何工具能按条款测量这种影响、在交付前预测它,或在同等预算下修复它。\sysname{}仅凭模型API弥合这三个缺口:合同账本将每条约束与可执行检查器配对、把撤销记录为墓碑(tombstone),并提前把净约束状态编译为单一规范;顺序消融探针测量每条款的遵循度与增量行为效应;修复阶梯在token与尝试次数对齐的预算下运行。在\dataname{}(\NTasks{}个HumanEval任务、\NClauses{}个经验证的检查器)上,随着约束负载增长,8B规模工作点的复发率从\ScaleDelayedMTwo{}攀升至\ScaleDelayedMEight{},而更强的模型处于底线水平。在检查器、模型与预算对齐的条件下,提前编译相对无账本的验证器重试基线显著降低复发(\RestoreDiff{},95%置信区间\RestoreDiffCI{},p值\RestoreDiffP{});在其上叠加自适应阶梯干预未检测到额外增益(95%置信区间排除大于等于\LadderExcludedGain{}的增益)。探针可在交付前预测复发(AUROC \AurocPrimary{});一句墓碑注释可恢复约三分之一的编译效果,并通过安慰剂对照检验。在每条结果\CostDeliveryFactor{}的交付开销与\CostTotalHedged{}的API计算量下,撤销失效成为对话状态中可测量、可预测、可修复的属性,而非不可见的属性。