论文

Speech2Grasp:将文本条件抓取检测数据有效地传输到人形机器人中的语音

Speech2Grasp: Data-Efficient Transfer of Text-Conditioned Grasp Detection to Speech in Humanoid Robots

模型训练参数高效训练

摘要

人形机器人越来越需要多模式理解来与人类自然交互。尽管视觉语言模型很突出,但它们通常假设文本输入而不是更自然的语音输入。在本文中,我们研究了是否可以以数据有效的方式将完善的文本条件模型转移到语音。使用 ALBEF 作为案例研究,我们进行的诊断分析表明,基于 MLP 的轻量级投影仪可以有效地使其适应语音,同时保留语义辨别力和鲁棒性。受这些发现的启发,我们引入了 Speech2Grasp,这是一个将文本条件抓取检测数据高效传输到语音的框架。现实世界的人形机器人实验表明,Speech2Grasp 的性能优于基于 ASR 的级联管道,同时减少了推理延迟。我们的研究结果提出了一种将已建立的文本条件系统扩展到语音的实用范例。