论文
经过验证的工具调用提高了 LLM 代理在非原子故障下的可靠性
Verified Tool Calls Improve LLM Agent Reliability Under Non-Atomic Failures
摘要
大语言模型 (LLM) 代理依靠外部工具来执行多阶段任务。现有的代理框架通常假设工具调用是原子的,并返回二进制成功或失败信号。然而,现实世界的系统表现出非原子行为,例如调度后超时、延迟可见性和部分状态更新。这些不匹配会导致可靠性问题,包括重复操作、任务成功和不必要的工具执行。引入了一种轻量级的验证感知工具包装器,它通过后置条件验证、重试前验证逻辑和幂等性密钥来增强工具调用。该方法在受控模拟环境中进行评估,并跨多个任务模板注入非原子故障。结果表明,所提出的方法显着减少了重复操作,同时保持了可比较的任务成功率。总体而言,研究结果表明,加强工具交互语义是提高 LLM 代理可靠性的一个有前途的方向,而无需修改底层语言模型。