论文
自我反思 API:AI 代理恢复的结构胜过冗长
Self-Reflective APIs: Structure Beats Verbosity for AI Agent Recovery
摘要
当人工智能代理调用 API 并遇到验证错误时,它需要的不仅仅是出错的地方 - 它需要下一步做什么。自反射 API 在验证失败时返回机器可读的 recovery\_feedback.suggestions[] 负载,足以让代理修复请求并重试,而无需外部推理。在经过泄漏审计的试点项目中(每个单元 $N{=}30$,3 个 LLM,10 个对抗性任务),结构化建议将任务完成率提高了 $+36.7$--$40.0$pp,比人类模型上的简单英语诊断(Fisher 的精确 $p \le 0.0022$)提高了 $1.8$--$2.2\times$ 的任务完成率更好的每次成功词元效率。 gpt-4o-mini 上的提升并不显着 ($p{=}0.435$);计费 API 上的第二域复制证实了这一模式。只有在审核 LLM 基准测试中两类未记录的答案泄漏之后,这种比较才成立。我们将audit\_prompt\_leakage.py 作为可重用的 CI 基础设施提供。代码和数据:https://github.com/arquicanedo/self-reflective-apis。