论文

Agentic AI对不一致与不完整工具响应的鲁棒性分析

Robustness Analysis of Agentic AI to Inconsistent and Incomplete Tool Responses

模型评测鲁棒性、公平性与可信度评测

摘要

对不良工具返回的鲁棒性,意味着以该返回所要求的方式予以回应,而这取决于工具是如何出错的。一个已经失效的工具与一个返回格式良好之假话的工具,是有着不同对策的不同问题。我们要问的是:这两种情形在返回到达的那一刻是否已然可以区分。这是一项定性试点研究:我们对单个决策点打分,而非把智能体运行到任务完成。我们向一个零售客服领域注入受控故障,并从模型的对数概率中读取两个通道:返回内容在仅工具模式(schema)下与在整个轨迹下的似然,以及其在合法动作上的分布——既读分布的形状,也读质量所在之处。不完整的返回在每一种情形下都可辨识:它在仅模式下的似然低落到一个其他任何条件都不会进入的区间,并且只要存在移动余地,它就把质量推向重新读取状态的工具。不一致的返回则不触动模式通道,而是在似然比较中体现于那个其真值已被上下文逐字携带的字段上,而非体现于矛盾贯穿领域政策的字段上。动作分布为每种条件给出各异的签名,但其排序依据是返回与下一动作的关联程度,而非故障族。因此,识别是不对称的:每种条件在某些通道中可辨识,但没有一个通道能辨识所有条件。