论文

意想不到的机器人政策:RoboDojo 及其他平台上 GPT-6 Astra 的早期评估

An Unexpected Robot Policy: Early Evaluations of GPT-6 Astra on RoboDojo and Beyond

智能体系统Agent任务评测

摘要

实体人工智能系统通常分为系统 1 和系统 2。系统 1 通常是一个预训练的策略,会高频生成动作,而系统 2 通常被实例化为用于高级规划的视觉语言模型。我们询问大型语言模型(LLM)是否可以作为机器人操作的策略,而无需针对特定任务进行微调。我们将此设置称为 LLM 政策。我们评估了三位大语言模型在所有 42 项 RoboDojo 任务上的表现,并将他们的分数与 40 项公共政策进行了比较。 Astra和GPT-5.5使用官方的每任务50集协议; DeepSeek-Flash 每个任务使用 10 个情节。 GPT-6 Astra 在 2,100 次试验中取得了 22.48% 的平均成功率和 28.97 分,排名高于所有公开参赛作品。然而,在相同的后处理下,GPT-5.5 和 DeepSeek-Flash 的平均成功率仅为 0.88% 和 1.92%。我们发现 Astra 表现出明显两极分化的能力概况。它可以很好地推广到需要语义理解但不需要高精度控制的任务。相比之下,它在需要精确、动态控制或复杂双手协调的任务上表现不佳。上下文实验表明,一次性演示并没有带来总体好处,而选定的交互痕迹显示了扰动下的剧集内校正。总体而言,评估的大语言模型在操纵性能方面差异很大。尽管可靠的精度和动态控制在评估环境中仍然存在局限性,但 Astra 脱颖而出,为通用操纵模型的潜力提供了初步证据。