论文
TALK-Dem:痴呆症相关沟通模式下的具体任务规划基准测试
TALK-Dem: Benchmarking Embodied Task Planning under Dementia-Associated Communication Patterns
摘要
现有的大语言模型驱动的机器人任务规划器依赖于对理想用户的理所当然的假设,其指令清晰、完整且以任务为中心。然而,在与现实世界的用户互动时,尤其是那些有认知障碍的用户,例如痴呆症患者(PLWD),规划者经常会犯错误,甚至带来人身安全风险。我们提出了 TALK-Dem(痴呆症的说话属性和语言知识),这是评估痴呆症相关言语交流下大语言模型驱动的机器人任务规划的第一个基准。 TALK-Dem 包含 4,800 条指令,涵盖五种典型的沟通模式,包括指称不精确、对象替换、空洞言论、主题漂移和入侵,三个强度级别。六个开放权重大语言模型的实验揭示了巨大的鲁棒性差距。在各种通信模式中,与理想指令相比,开放权重模型的性能下降高达 22.3 个百分点。这揭示了现实世界应用程序的一个关键差距甚至危险,特别是在辅助机器人技术中,由于隐私问题和连接限制,本地可部署的模型是必要的。为了缓解这个问题,我们提出了上下文感知经验检索(CARE)方法,该方法检索先前解决的相关任务以提供特定于任务的解释和规划上下文。在六个开放权重模型中,CARE 的表现总体优于标准提示基线,与普通提示相比,平均任务成功率提高了 18.1 个百分点。这些结果凸显了评估通信鲁棒性和为本地可部署辅助机器人制定有效适应策略的重要性。 TALK-Dem 数据集可在 https://anonymous.4open.science/r/TALK-Dem-A6B3/. 上公开获取