论文

Skill-3D:不断发展的场景感知技能以实现代理 3D 空间推理

Skill-3D: Evolving Scene-Aware Skills for Agentic 3D Spatial Reasoning

智能体系统Agent Skills

摘要

本文探讨了代理 3D 空间理解,即 MLLM 代理通过工具使用执行 3D 推理。现有方法经常滥用工具并在 3D 场景下表现出有偏见的工具偏好,使得代理范式仅比非代理策略有边际收益。我们发现,3D 空间推理任务在不同场景中是异构的,而这些代理对所有场景应用统一的工具使用策略,而不是根据特定场景和任务选择工具。为了解决这个问题,我们提出了 Skill-3D,这是一个学习自我进化的场景感知技能的框架。具体来说,Skill-3D 识别任务场景并将代理的工具使用轨迹记录到场景内存中,其中来自相似场景的成功轨迹被聚合并提炼成可重复使用的场景感知技能,而失败的轨迹则作为课程附加到该技能中。在训练过程中,一旦出现类似的场景,就会注入相应的技能来引导智能体,产生新的轨迹,新的轨迹的成功和失败进一步细化技能,形成记忆和技能库共同进化的循环。实验表明,Skill-3D 大幅提高了 3D 空间推理中的工具利用率(在 VSI-Bench 上从 39% 提高到 78%),推动智能体正确且充分地使用工具。例如,它在 MMSI-Bench 上将 Gemini-3-Flash 提高了 67%。此外,我们在技能引导轨迹上进行代理 后训练,这将 VSI-Bench 上的 Qwen3-VL-8B 提高了 60%。