论文
可调用性并非可操作性:LLM 代理的受控接口干预
Callability Is Not Operability: Controlled Interface Interventions for LLM Agents
摘要
工具调用可能完全有效,但仍然让自主代理无法确定下一步该做什么。例如,如果外部效果提交但其响应丢失,则代理可能无法区分已提交和未提交的状态,即使它们需要不同的继续操作。我们研究可调用性和可操作性之间的差距:工具接口是否公开了代理在操作不确定性下安全继续所需的与操作相关的状态和语义。我们通过代理优先工具(AFT)来操作工具的可操作性,这是一组涵盖选择性能力发现、执行生命周期和恢复、显式外部效应语义、机器可读结果和后置条件验证的接口机制。我们引入了 AFT-Bench,这是一个受控的接口干预框架,它可以固定任务、后端、初始状态、注入的故障、代理和语言模型,同时改变暴露给代理的接口。