Exactly-Once住在哪里?模型、利用和工具契约对 LLM 代理中重复副作用的影响
Where Does Exactly-Once Live? Model, Harness, and Tool-Contract Effects on Duplicate Side Effects in LLM Agents
摘要
当使用工具的代理的写入超时或返回服务器错误时,该操作可能已经生效。重试会盲目地重复它——第二次充电、第二次公告、第二次部署——而放弃会跳过所需的工作。我们询问应该在哪里强制执行一次性行为:在模型中、在代理工具中还是在工具契约中。我们引入了 LIMBO,这是一个由六种服务组成的确定性沙箱,具有现实合约(可选的幂等性密钥、最终一致和缺失的读取路径)和在服务边界注入的十二种故障模式,包括延迟提交、重新交付和部分批次;每一集都根据承诺效果的分类帐进行评分。跨越 25,930 个情节,涵盖 9 个最新型号、3 个生产代理Harness、2 个合同变体和 15 个恢复条件,答案取决于故障。当立即回读可以揭示发生了什么时,模型会决定:指示只执行一次的前沿模型几乎不会重复确认丢失的写入(0.5%),而较弱的模型经常会这样做,并且模型解释了所解释方差的 53%。当它不能时——请求仍在飞行中,或者运输两次交付——相同的边境模型在 56% 和 74% 的剧集中重复,合同解释了 81%。我们证明,在没有运行时间限制的情况下,仅验证策略在延迟提交的情况下不会是一次性的。当这样的界限很短且已知时,等待是有效的,但由于飞行中的延迟很严重,即使每集等待一个小时,也无法在每次写入时提供幂等密钥,这会将重复率从 28% 降低到 4%,因为代理在密钥存在时使用密钥。Harness几乎不重要,连接钥匙的警卫在Harness之间的传输保持不变,特工们报告说,他们在复制效果的场景中 90% 都取得了成功。