论文
DexHoldem:德州扑克中灵巧操作的代理机器人基准
DexHoldem: An Agentic Robotics Benchmark for Dexterous Manipulation in Texas Hold'em
摘要
使用真正灵巧的硬件评估具体系统需要的不仅仅是孤立的运动技能测试:代理必须感知不断变化的场景(例如桌面),选择适合上下文的动作,用灵巧的手执行它,并使场景可用于以后的决策。我们介绍 DexHoldem,这是一个全面的现实世界基准,用于评估与 ShadowHand 相关的德州扑克相关灵巧操作。 DexHoldem 提供了 1,470 个远程操作演示,涉及 14 种德州扑克操纵原语、标准化的物理策略基准和代理感知基准,用于测试代理是否可以恢复具体决策所需的结构化游戏状态。在原始执行中,$π_{0.5}$ 获得最高的任务完成率 ($61.2\%$),而 $π_{0.5}$ 和 $π_0$ 的场景保留成功率并列 ($47.5\%$)。在主体感知方面,Opus 5.5 在严格的问题级准确度 ($49.1\%$) 和平均领域准确度 ($80.6\%$) 上都以微弱优势领先;两者之间的差距暴露了孤立的视觉子功能和完整的路由相关状态恢复之间的距离。最后,我们实例化了完整的具体代理循环,其中一个代理与策略配对超过 33 个闭环手级部署,其中仅完成了 $12.1\%$ 的手;重试在 34 次调度中的 12 次中恢复了失败的原语,并解决了 4 个已完成的手中的 3 个中的长期执行停顿问题,否则需要手动终止。只有一只手完成,既没有重试,也没有人工帮助请求。因此,DexHoldem 评估共享物理环境中灵巧的桌面执行、代理感知和具体决策路由。项目网站:https://dexholdem.github.io/Dexholdem/