论文
PhysAI-Bench:面向以无人机为中心的物理AI中LLM Agent决策的基准
PhysAI-Bench: A Benchmark for LLM-Based Agentic Decision-Making in Autonomous UAV-Centric Physical AI
摘要
物理 AI 的最新进展加速了基础模型在无人机(UAV)等自主系统中的应用,这些系统必须在动态环境中感知、推理、规划和行动。现有基准评估物理感知、直觉物理、具身导航和协作推理,却很少评估可靠自主性所需的智能体决策。我们提出 PhysAI-Bench 来评测这一能力。它包含 10,178 个标准化决策实例,自动提取自自主无人机任务的对话轨迹。每个实例保留任务上下文、时间依赖、物理约束、Model Context Protocol(MCP)工具调用、Agent-to-Agent(A2A)交互、传感器观测以及 AI 原生 6G 网络条件(包括延迟、丢包、吞吐量、边缘负载和网络切片)。每个决策只暴露其之前的信息,防止未来事件泄露,近似在线决策。我们用两阶段协议评测 29 个基础模型:先在 35 个经人工核验的开发实例上,从零样本、三样本、五样本提示与四个温度的 12 种组合、各三次运行中选取模型特定配置;随后冻结所选配置,在一个固定的、与开发集不重叠的 500 实例集合上运行三次评测。GPT-5.3 取得最高准确率(52.00%),其后是 GPT-5.2(49.40%)和 Grok 4.5(49.07%)。少样本提示总体提升性能,而温度影响有限。结果表明物理 AI 中可靠的智能体决策仍是未解难题。数据集已公开。
