论文

发生故障的机器人何时应该询问?根据经过审核的传感器证据启动纠正性人机对话

When Should a Failing Robot Ask? Initiating Corrective Human-Robot Dialogue from Audited Sensor Evidence

模型评测鲁棒性、公平性与可信度评测

摘要

任务失败的机器人面临纠正对话中的第一个决定:根据自己的诊断采取行动,咨询另一个机载传感器,或者打断人。做出好的选择需要了解机器人的传感器揭示了多少原因以及机器人自身的诊断有多可靠。我们建立了一个模拟基准,其中每个故障的真正原因都是已知的,因为我们注入了它,并测量每个传感器揭示的内容,并明确检查数据泄漏。有些故障可以通过摄像头图像来诊断;其他仅来自机器人的力数据(来自力数据的 0.99,没有高于 0.55 的图像方法)。然后我们测试了六种开放视觉语言模型。他们的行为只跟踪提示的表面,而不是证据:将拒绝选项从答案列表中的最后一个移动到第一个,在六对模特和家庭中的三对中,拒绝率从 78-100% 下降到 0-6%。在每个提示变体下,无论有或没有工作示例,框架的准确性都保持在或低于多数类基线,并且声明的置信度不包含有关正确性的信息。将相同的模型作为十行文本处理力数据会产生第一个高于基线的诊断,在六个模型中的四个中:大部分故障反映了传感器数据的缺失,而不是能力的缺失。我们将选择作为一个三动作决策问题,采取行动,咨询您自己的传感器,或询问人类,其最佳策略来自测量的准确性。这些模型不遵循它,并且它们的询问率忽略了问题成本的四倍变化。向人类提出一个问题仍然会将他们从该基线提升到大致回答者自己的可靠性(当他们提问时为 0.70-0.81)。询问的决定应与测量的准确性和规定的成本相关,而不是与模型的置信度相关。