论文
探测具身LLM:更高的观测保真度何时损害问题求解
Probing Embodied LLMs: When Higher Observation Fidelity Hurts Problem Solving
摘要
大语言模型越来越多地被提议作为机器人系统的认知组件,但其不透明的决策过程使闭环具身任务中的成功或失败难以解释。遵循经验主义AI方法论,我们以行为学方式研究具身LLM智能体:改变智能体可获得的信息并测量由此引起的行为变化。利用Lockbox——一种具有隐藏相互依赖关系的顺序机械谜题——我们在物理机器人装置上评估LLM在RGB、RGB-D与真值符号观测下的表现,并用受控仿真探究由此产生的行为。反直觉的是,智能体在原始RGB输入下表现最好,而在完美的真值观测下表现最差。在仿真中,我们通过随机翻转感知到的动作结果来探究这一效应,发现适度噪声能提升性能,在40%的翻转概率处达到峰值,成功率较无噪声基线提高2.85倍。进一步分析将这一增益与重复动作循环的减少联系起来。这些发现表明,仅凭成功率不足以评估LLM,因为测得的性能可能反映的是感知误差与推理失败之间的相互作用,而非稳健的问题求解能力。
