论文

从以人为中心的多模态观察中进行主动机器人的认知行为推理

Cognitive Action Reasoning for Proactive Robots from Human-Centered Multimodal Observations

模型评测基准与评测资源

摘要

在以人为中心的环境中运行的机器人通常被设计为执行明确的指令,并且大多数机器人学习数据集同样将观察结果与任务指令或低级操作配对。尽管最近的工作已经开始探索主动的具体援助,但现有资源针对不同的环境和行动水平,导致现实世界中以人为本的多模式决策尚未得到充分探索。我们将这个问题表述为 \textit{主动机器人动作推理} (\textit{ProRobo}),这是一个上游认知决策问题,其中机器人必须根据多模态人类和环境线索确定采取哪个动作,而无需明确的动作指令。为了支持 ProRobo,我们引入了 \textit{ProAction},这是一个真实世界的多模式数据集,包含 5 个常见场景中 12 个日常生活场景的 10K 个视觉观察、音频信号和文本输入样本。为了构建基于认知的高级行动监督,我们开发了一个两阶段的人机循环管道,将评估引导的候选生成与情感理论引导的人类细化相结合,明确地将有关人类状态、紧迫性、可行性和潜在风险的上下文判断纳入行动注释中。基于这种监督,我们对代表性的多模态大语言模型(MLLM)进行了基准测试,并引入了 \textit{MMC2Act},这是一个隐式学习从多模态观察到基于认知的高级动作的映射的参考模型。跨模态设置、主题不相交泛化、跨数据集传输和人类评估的实验表明,通用 MLLM 难以根据多模态线索主动推理高级动作,而 \textit{ProAction} 上的训练可显着提高性能。