论文
面向韧性视觉智能体的模式语言
A Pattern Language for Resilient Visual Agents
摘要
将多模态基础模型集成到企业生态中,构成了一个根本性的软件架构挑战。架构师必须权衡相互竞争的质量属性:视觉-语言-动作(VLA)模型的高延迟与非确定性,对阵企业控制回路所要求的严格确定性与实时性能。在本研究中,我们提出一种面向视觉智能体的架构模式语言,将快速、确定性的反射与缓慢、概率性的监督分离开来。它由四个架构设计模式组成:(1)Hybrid Affordance Integration(混合可供性集成)、(2)Adaptive Visual Anchoring(自适应视觉锚定)、(3)Visual Hierarchy Synthesis(视觉层级合成)与(4)Semantic Scene Graph(语义场景图)。
