论文

DreamLedger:在哪里使用执行结算的信用来拒绝世界模式的想象力

DreamLedger: Where to Refuse World-Model Imagination Using Execution-Settled Credit

智能体系统Agent 动作执行与治理

摘要

世界模型预测告知机器人行动,但瞬时可靠性信号并不能保留过去可比预测的结果。 DreamLedger 将消耗的预测注册为索赔,根据执行结果进行结算,并使用来自可比操作条件、区域和预测范围的持续执行历史记录来估计未来依赖之前的信用。可重播的记录将每个决策与其支持证据和最终结果联系起来。在匹配拒绝量的十种子导航比较中,删除历史特征或重置历史会增加燃烧率,以每个消耗预测的失败来衡量。在匹配的拒绝量下进行的独立十种子操作复制发现,相对于随机拒绝,DreamLedger 将烧毁率降低了 4.8 个百分点(95% CI:0.8-8.7),并且使用了更少的探针。随机审计直接测量被拒绝的候选人中较高的失败率,而热身后的转变隔离了新累积的和解的贡献。 Franka 实验通过重放所有 1,062 个预测用途来建立在线部署,并展示预期的门转换:新的失败将先前的高信用降低到冻结阈值以下,从而在下一步行动之前触发拒绝。任务完成和验证成本表征了这些干预措施的权衡。