论文
压缩作为认知失败:Agentic LLM 工具如何从被终止的进程中生成确认的结果
Compaction as Epistemic Failure: How Agentic LLM Tools Fabricate Confirmed Results from Killed Processes
摘要
代理 LLM 编码工具将长会话历史记录压缩为后续会话作为 真值 继承的压缩摘要。本文记录了 Claude Code 中的一种故障模式,其中超时命令(退出代码 143)的部分标准输出被记录在压缩摘要中作为确认结果,从而在会话和模型版本之间传播误报而无需重新验证。底层机制是观察和持久性的结合,其中出现在终端中的信息被视为等同于写入持久存储的信息。这一发现扩展了对 LLM 自我评估失败的分析,该分析在之前关于 LLM 作为法官评分的非确定性的工作中报告,表明代理工具在报告自己的操作结果时表现出类似的可靠性缺陷。该故障对依赖代理会话连续性进行数据处理、科学计算或多步骤自动化的任何工作流程都有直接影响。