论文

LLM Agent环境中的审计行动结算:顺序、进度和重播

Auditing Action Settlement in LLM Agent Environments: Order, Progress, and Replay

智能体系统Agent 环境交互Agent Harness

摘要

即使每个提案单独有效,大语言模型 (LLM) Agent环境中的并发操作也需要仲裁。我们实现了一个类型化的快照结算合约,并审核三个不同的属性:订单敏感性、有用进度和重放一致性。五项和解政策在 28,800 次详尽的排列试验和 2,160 个脚本化的多步骤片段中进行了测试。联合策略在固定优先级上是空间顺序不变的,但保守的拒绝在六智能体门口任务中仅完成了 31.25% 的智能体,而随机票证则为 90.28%;配对改进为 59.03 个百分点(95% 自举区间:50.00-68.06)。所有策略都保留了经过测试的空间约束,并且优先级仲裁仍然错过了独立的小实例最优值。单独的全状态日志审计准确地重放了 156 个检查点,并拒绝了 1,332 个保留终端锚点的构造损坏。证据涉及执行语义,而不是人类现实主义或长期公平性。