论文

ORDDAR:以观测驱动推理实现抗失真决策、行动与认知恢复

ORDDAR: Observation-Driven Reasoning for Distortion-Resilient Decision, Action, and Cognitive Recovery

模型推理上下文与知识推理验证与自校正记忆Agent记忆

摘要

人工智能代理越来越多地执行长期推理、规划、工具使用、内存集成和自主决策,但错误的中间状态可能会传播并导致不一致的决策和不可靠的输出。现有的推理方法主要依靠迭代规划、自我反思、增强记忆或验证,但很少定位和选择性修复错误的推理。我们提出了 ORDDAR(用于失真弹性决策、行动和认知恢复的观察驱动推理),这是一个推理框架,它将推理建模为认知状态转换,检测局部失真,从先前的经验中检索相关推理,并仅修复受影响的状态。因此,ORDDAR 在局部推理转换级别执行恢复,而不是重新生成完整的轨迹。数学、常识、多跳和临床推理基准的实验表明,与多个评估的推理基线相比,推理质量、恢复能力和可解释性得到了提高。

ORDDAR:以观测驱动推理实现抗失真决策、行动与认知恢复:论文配图
图1:ORDAR的概况。该框架发现推理扭曲现象,通过认知镜回收恢复补充,有选择地修复被破坏的推理状态,并预测最终决定。