论文
闭环:通过 LLM-RL 耦合实现统一 3D 场景生成和沉浸式交互
Closing the Loop: Unified 3D Scene Generation and Immersive Interaction via LLM-RL Coupling
摘要
大语言模型 (LLM) 的最新进展显着改进了语言驱动的 3D 内容生成,但大多数现有方法仍然将场景生成和用户交互视为单独的过程,限制了交互式多媒体系统的适应性和沉浸式潜力。本文提出了一个统一的框架,可以闭合语言驱动的 3D 场景生成和沉浸式用户交互之间的循环。给定自然语言指令,系统首先使用 LLM 构建结构化场景表示,然后在几何和语义约束下通过强化学习优化空间布局。生成的环境部署在虚拟现实环境中,以促进 HRI 循环,其中用户交互提供持续的反馈,以使生成的内容与人类感知和可用性保持一致。通过紧密耦合生成和交互,所提出的框架可实现更具响应性、适应性和真实性的多媒体体验。 ALFRED 基准测试展示了基于任务的场景生成的最先进的性能。此外,定性结果和用户研究表明沉浸感、交互质量和任务效率的持续改进,凸显了下一代多媒体系统的生成和交互闭环集成的重要性。我们的项目页面可以在 https://proj-showcase.github.io/h3ds/ 找到。