论文

更少的词元,更好的行动:GPT-6 Astra 机器人Agent的成功率提高了 14%,但词元减少了 65%

Fewer Tokens, Better Action: GPT-6 Astra Robot Agents with 14% Higher Success Rate but 65% Fewer Tokens

智能体系统Agent Harness

摘要

视觉语言模型(VLM)Agent可以通过视觉反馈和动作原语控制机器人,但重复的模型调用和冗余观察会产生大量的词元开销。我们引入了 PyRUA-Lean,一个交互式代码执行框架,它将反馈驱动的基元组合与选择性观察结合起来:Agent将经典的机器人基元和学习的视觉语言动作(VLA)策略组合到执行条件检查和本地重试的 Python 单元中,仅返回明确请求的图像和状态反馈以进行重新规划。在 LIBERO-PRO、RoboTwin 2.0 和 RoboCasa365 的 700 个模拟任务实例中,我们使用相同的 GPT-6 Astra 规划器和底层机器人原语将 PyRUA-Lean 与工具调用基线进行比较。在同等的 LLM 呼叫预算下,PyRUA-Lean 将总体成功率从 63.1% 提高到 71.7%。在两个Agent解决的实例上,它使用的 LLM 调用减少了 49%,输入词元减少了 65%。