论文
改变行动的记忆不是指导行动的记忆:对历史条件机器人策略的反事实审计
Memory That Changes Action Is Not Memory That Guides It: Counterfactual Auditing of History-Conditioned Robot Policies
摘要
将块返回到其原始托盘的机器人可能会遇到两个任务一致的过去,它们重新收敛到相同的当前输入,但需要采取不同的操作。然而,记忆策略评估通常依赖于任务成功或记忆扰动下的行动变化,这两者都不能证明记忆指导决策。我们提出了 \textbf{Counterfactual Memory Audit (CMA)},这是一种评估协议,它在经过验证的相同当前情况下跨越两个历史,在共同随机性下查询冻结策略,并评估两个过去下每个保存的操作。这将内存敏感性、保证选择、匹配世界物理值和每对可靠性分开。在 Mem-0 上,每个经过审核的 Put Back 对都会更改操作,但只有 $20/64$ 对是完全可靠的;在稍后的交换决策中,所有配对的操作都会发生变化,同时两个内存都会选择相同的分支。本机干预进一步显示了闭环影响:替换历史记录银行会将行为重定向到被替换的内容,同时恢复 4096 字节受保护的锚点可恢复因注入银行故障而损失的 38.9 美元的交换成功点。在双臂物理平台上,内存更改保存了操作,但九个已完成的“放回”操作中有五个到达了错误的目标。这些结果表明,机器人可以记住并做出反应,而无需可靠地使用记忆来选择其过去所保证的行为。 CMA 提供决策级审核来区分这些情况。