论文

PhysNote:面向视觉语言模型可演化物理推理的自知识笔记

PhysNote: Self-Knowledge Notes for Evolvable Physical Reasoning in Vision-Language Model

上下文与知识记忆Agent记忆

摘要

视觉语言模型(VLM)在教科书式物理问题上已展现出强大性能,但在面对需要跨帧时间一致性与因果推理的动态现实场景时却经常失败。我们识别出这些失败背后的两个根本挑战:(1)时空身份漂移(spatio-temporal identity drift),即物体在连续帧之间丢失其物理身份并破坏因果链;(2)推理时洞察的易变性(volatility of inference-time insights),即模型可能偶尔产生正确的物理推理,却从不将其巩固以供未来复用。为应对这些挑战,我们提出 PhysNote,一个使 VLM 能够通过自生成的“知识笔记”(Knowledge Notes)外化并精炼物理知识的智能体框架。PhysNote 通过时空规范化稳定动态感知,将自生成的洞察组织进分层知识库,并驱动一个迭代推理循环,在巩固已验证知识之前先将假设锚定于视觉证据。在 PhysBench 上的实验表明,PhysNote 达到 56.68% 的总体准确率,较最佳多智能体基线提升 4.96%,并在全部四个物理推理领域取得一致增益。

PhysNote:面向视觉语言模型可演化物理推理的自知识笔记:论文配图
图 1:PhysNote 框架概述,该框架跨三个互连空间运行,以实现可进化的物理推理。视觉锚点(左):给定问题 QQ 和视觉输入 VV(图像或视频),时空接地引擎为每个视觉实体分配一个不可变标识符(例如 [#0_ball_blue]),以生成规范化输入流 V^\hat{V},从而建立跨帧的对象持久性。代理推理(中):InfoAgent 𝒜\mathcal{A} 从分层知识注释 𝒩\mathcal{N} 中检索与任务相关的上下文,并将其组织为一般提示、任务描述和详细信息。然后,它执行迭代的假设-证据-验证循环,从视觉数据中提取结构化的三元观察⟨ID,Anchor,State⟩\langle\text{ID},\text{Anchor},\text{State}\rangle,以构建有根据的推理轨迹𝒫\mathcal{P}。如果证据差距仍未消除,退化推理模式将应用启发式回退来产生最终答案𝒜\mathcal{A}。知识注释(右,仅训练):更新资格检查 Φ⁡(𝒫)\Phi(\mathcal{P}) 评估推理轨迹是否满足知识巩固的标准。符合条件的痕迹(Φ=True\Phi=\textit{True})被合成为更新的知识笔记;通过自主去噪和剪枝去除错误率持续较高的任务节点,确保知识库朝着更高的保真度发展。