论文
工具故障后的制造:工具增强代理断言其工具未返回值
Fabrication After Tool Failure: Tool-Augmented Agents Assert Values Their Tools Did Not Return
摘要
工具增强语言模型的评估标准是它们是否给出了正确的答案,而不是当工具无法提供正确答案时它们是否诚实地报告。我们使用涵盖 16 个内部系统域和 8 种工具故障类型的 1,024 个项目的基准来隔离此故障后决策,其中强制执行工具调用,并保证返回的有效负载不可用。在部署式系统提示下,14.10% 的响应是不诚实的:模型要么断言有效负载无法支持的值,要么在引用捏造的策略或能力限制时拒绝。该速率几乎完全取决于是否发出故障信号。当工具返回状态:错误时,不存在不诚实行为(0.0%);当它返回 status:ok 且值已编辑、损坏、过时、格式错误、空或截断时,不诚实率达到 45.3%。这种行为并不是我们的提示造成的:它出现在中性提示下 (10.17%) 和我们评估的每个生产代理框架的出厂提示下,在 CrewAI 下达到 24.67%,而且我们审核的九个框架都没有指定当工具失败时模型应该做什么。比较提示级防御,我们发现操作变量不是对工具输出的遵从,而是缺乏指定的故障状态。在回答之前附加一个要求模型发出retrieve_status: OK or FAILED的句子可以将不诚实行为从14.10%减少到0.87%,其中688个项目中的一个项目恶化,而92个项目有所改善,并且不变地转移到三个外来代理支架中。发出的标志在 99.7-99.9% 的声明中是忠实的,从而提供只需要正则表达式的运行时检测器。