论文

通过自动嵌入对话增强推进 DialNav

Advancing DialNav through Automatic Embodied Dialog Augmentation

模型训练合成数据

摘要

对于能够进行物理交互的实体主体来说,创建和理解对话的能力对于确保安全性和有效性至关重要。虽然 DialNav~\cite{han2025dialnav} 提供了一个用于对逼真的室内导航中的对话执行循环进行整体评估的框架,但其性能仍然受到训练数据严重缺乏(2K 集)的限制。为了解决这个问题,我们提出了一个自动生成管道,并构建了 \textbf{RAINbow} 数据集,这是一个包含 238K 集的 DialNav 大规模训练数据集。我们的管道将现有的 VLN 数据集转换为多轮对话,并创建具有成本效益的高质量数据集。然后,我们引入了另外两项互补的进步来释放数据的全部潜力:(1) 双策略训练,一种将导航训练与动态对话导航循环相结合的导航训练方案,以及 (2) 利用 VLN 知识的本地化模型。通过结合这些互补的解决方案,我们的模型在 \textbf{Val Seen} (58.24, \textbf{+89\%}) 和 \textbf{Val Unseen} (29.05, \textbf{+100\%}) 分割的成功率上显着优于基线,建立了新的技术水平。