论文
隐藏目标下零射击人机协调的结构化 LLM 推理
Structured LLM Reasoning for Zero-Shot Human--Robot Coordination Under Hidden Goals
摘要
我们提出了一种结构化大语言模型(LLM)架构,用于在具有私有目标视图的协作构建任务中进行零样本人机协调。在 Dec-POMDP 公式的指导下,该架构将决策分解为 (i) 行动条件心理理论 (ToM) 推理、(ii) 分层规划、(iii) 对话解释、(iv) 行动验证和 (v) 基于反馈的重新规划。我们将所提出的方法与没有 ToM 推理的消融以及在许多目标对上离线训练的多智能体强化学习策略进行比较。在人类参与者实验中,所提出的方法比两个基线需要更少的交互步骤,并且产生更高的交互后信任评级。这些结果表明,系统地分解团队决策问题,使用 LLM 作为棘手的推理和规划计算的易处理替代品,并保留物理可行性的常规验证可以改善任务协调和人类体验。