论文
PAU:通过黑盒交互评测Agent对代码API的理解
Toward Interactive Understanding of Code APIs
摘要
在语言模型Agent的进步的支持下,系统在代码生成和理解方面取得了长足的进步。然而,这些方法通常依赖于对相关代码的读取访问,这种假设在处理外部 API 时并不成立。在这项工作中,我们引入了 PAU(Python API Understanding)基准,其中我们为模型提供了对代码片段的黑盒、API 级访问。模型必须通过探索性输入查询 API,并从结果输出中获取见解,目的是描述代码片段的真实功能。通过将代码片段视为必须仅通过交互来理解的外部工具,PAU 研究了无监督工具理解的更普遍问题,特别是对于作为 Python 方法实现的工具。尽管编码Agent最近取得了进展,但即使是前沿模型也难以在 PAU 上实现高性能,最好的模型 (Claude-4-Opus) 无法理解超过 45% 的 PAU 测试集。对常见错误模式的调查表明模型过于自信;他们经常高估当前假设的质量,导致探索不足和过早终止。最后,我们从机器人学习中经常使用的非对称演员评论家 (AAC) 范式中汲取灵感,对交互式代码理解的模型进行后训练。使用 AAC 训练的模型对 API 进行更积极的探索,AAC 调整的 Qwen3-8B 模型与 GPT-5-mini 的性能相匹配。
