论文
PhysNote:面向视觉语言模型可演化物理推理的自知识笔记
PhysNote: Self-Knowledge Notes for Evolvable Physical Reasoning in Vision-Language Model
摘要
视觉语言模型(VLM)在教科书式物理问题上已展现出强大性能,但在面对需要跨帧时间一致性与因果推理的动态现实场景时却经常失败。我们识别出这些失败背后的两个根本挑战:(1)时空身份漂移(spatio-temporal identity drift),即物体在连续帧之间丢失其物理身份并破坏因果链;(2)推理时洞察的易变性(volatility of inference-time insights),即模型可能偶尔产生正确的物理推理,却从不将其巩固以供未来复用。为应对这些挑战,我们提出 PhysNote,一个使 VLM 能够通过自生成的“知识笔记”(Knowledge Notes)外化并精炼物理知识的智能体框架。PhysNote 通过时空规范化稳定动态感知,将自生成的洞察组织进分层知识库,并驱动一个迭代推理循环,在巩固已验证知识之前先将假设锚定于视觉证据。在 PhysBench 上的实验表明,PhysNote 达到 56.68% 的总体准确率,较最佳多智能体基线提升 4.96%,并在全部四个物理推理领域取得一致增益。
