论文
InfluenceField:用于多模态世界建模的具有干预性可识别因果结构的可微分场
InfluenceField: A Differentiable Field with Interventionally Identifiable Causal Structure for Multimodal World Modeling
摘要
多模态 大语言模型 通常捕获视觉语言相关性,但很难预测局部视觉干预如何传播并影响下游答案。我们引入了 InfluenceField,一种插入视觉编码器和语言解码器之间的干预感知潜在场。它将补丁特征提升为连续的空间表示,在多个步骤中传播定向影响,并通过共享转换算子预测局部干预效果。联合训练优化了语言建模、跨环境不变性、反事实轨迹监督和结构正则化。对于非线性有限基群体模型,我们证明了目标对齐的干预监督以及转换上的一步分离条件,将可接受的表示限制为位置内重新参数化,从而准确地恢复了完整转换的有向依赖图。线性专门化给出了精确的部分覆盖特征和有限损耗稳定性界限,并且现场分析得出了系数干预的空间分布以及共享通道校准结果。在 CausalVQA 上,InfluenceField 将其骨干网的整体准确率提高了 13.1 个百分点,其中规划和假设类别的收益最大。能力匹配的基线和结构控制将稳健性和事实反事实一致性的收益归因于因果目标,而不是能力的增加。