论文
先描述再行动:通过蒸馏语言-动作世界模型实现主动式智能体操控
Describe-Then-Act: Proactive Agent Steering via Distilled Language-Action World Models
摘要
部署安全关键代理需要在执行之前预测操作的后果。虽然世界模型为这种主动预见提供了范例,但当前依赖视觉模拟的方法会产生令人望而却步的延迟,通常每步超过几秒。在这项工作中,我们挑战了视觉处理对于预防故障是必要的这一假设。我们表明,训练有素的策略的潜在状态与其计划的行动相结合,已经编码了足够的信息来预测行动结果,使得视觉模拟对于预防故障来说是多余的。为此,我们引入了 DILLO(DIstiLLed Language-Action World Model),这是一个快速控制层,可将范式从“模拟然后行动”转变为“描述然后行动”。 DILLO 通过跨模态蒸馏进行训练,其中一位享有特权的视觉语言模型教师注释离线轨迹,而一位潜在条件大语言模型学生学习预测语义结果。这创建了纯文本推理路径,完全绕过繁重的视觉生成,实现了基线 14 倍的加速。 MetaWorld 和 LIBERO 上的实验表明,DILLO 可以对下一个状态进行高保真描述,并且能够引导策略,将任务中的事件成功率平均提高高达 15 pp 和 9.3 pp。
