论文

探测具身LLM:更高的观测保真度何时损害问题求解

Probing Embodied LLMs: When Higher Observation Fidelity Hurts Problem Solving

智能体系统Agent任务评测

摘要

大语言模型越来越多地被提议作为机器人系统的认知组件,但其不透明的决策过程使闭环具身任务中的成功或失败难以解释。遵循经验主义AI方法论,我们以行为学方式研究具身LLM智能体:改变智能体可获得的信息并测量由此引起的行为变化。利用Lockbox——一种具有隐藏相互依赖关系的顺序机械谜题——我们在物理机器人装置上评估LLM在RGB、RGB-D与真值符号观测下的表现,并用受控仿真探究由此产生的行为。反直觉的是,智能体在原始RGB输入下表现最好,而在完美的真值观测下表现最差。在仿真中,我们通过随机翻转感知到的动作结果来探究这一效应,发现适度噪声能提升性能,在40%的翻转概率处达到峰值,成功率较无噪声基线提高2.85倍。进一步分析将这一增益与重复动作循环的减少联系起来。这些发现表明,仅凭成功率不足以评估LLM,因为测得的性能可能反映的是感知误差与推理失败之间的相互作用,而非稳健的问题求解能力。

探测具身LLM:更高的观测保真度何时损害问题求解:论文配图
图 1:我们的机器人系统操作密码箱。我们的锁箱由两个棱柱关节(中间的滑杆)和两个旋转关节组成。当最左边的旋转关节(我们称为目标关节)被拉动时,锁盒就会解锁。该机器人采用软手末端执行器来操纵关节,使用 RGB-D 相机来获取视觉数据,并使用力扭矩传感器来评估关节的可动性并指导其操作。