论文

PAU:通过黑盒交互评测Agent对代码API的理解

Toward Interactive Understanding of Code APIs

智能体系统Agent任务评测

摘要

在语言模型Agent的进步的支持下,系统在代码生成和理解方面取得了长足的进步。然而,这些方法通常依赖于对相关代码的读取访问,这种假设在处理外部 API 时并不成立。在这项工作中,我们引入了 PAU(Python API Understanding)基准,其中我们为模型提供了对代码片段的黑盒、API 级访问。模型必须通过探索性输入查询 API,并从结果输出中获取见解,目的是描述代码片段的真实功能。通过将代码片段视为必须仅通过交互来理解的外部工具,PAU 研究了无监督工具理解的更普遍问题,特别是对于作为 Python 方法实现的工具。尽管编码Agent最近取得了进展,但即使是前沿模型也难以在 PAU 上实现高性能,最好的模型 (Claude-4-Opus) 无法理解超过 45% 的 PAU 测试集。对常见错误模式的调查表明模型过于自信;他们经常高估当前假设的质量,导致探索不足和过早终止。最后,我们从机器人学习中经常使用的非对称演员评论家 (AAC) 范式中汲取灵感,对交互式代码理解的模型进行后训练。使用 AAC 训练的模型对 API 进行更积极的探索,AAC 调整的 Qwen3-8B 模型与 GPT-5-mini 的性能相匹配。

实现代码 API 的交互式理解:图1:用于交互式理解代码API的PAU基准。模型获得Python方法的黑盒访问权限(左),必须充分探索以生成其功能描述。我们从两个角度评估预测描述:使用标准功能描述,由语言模型评审器给预测打1至5分(含端点,右上);另用固定的代码生成模型把预测描述转成代码片段,在输入测试集上评估代码片段输出与真实代码输出一致的输入比例(右下)。
图1:用于交互式理解代码API的PAU基准。模型获得Python方法的黑盒访问权限(左),必须充分探索以生成其功能描述。我们从两个角度评估预测描述:使用标准功能描述,由语言模型评审器给预测打1至5分(含端点,右上);另用固定的代码生成模型把预测描述转成代码片段,在输入测试集上评估代码片段输出与真实代码输出一致的输入比例(右下)。