论文
通过角色的视角:解决多模态角色扮演代理中的模态角色干扰
Through the Lens of Character: Resolving Modality-Role Interference in Multimodal Role-Playing Agent
摘要
多模式 大语言模型 (MLLM) 的进步将角色扮演代理 (RPA) 扩展到视觉基础环境中。然而,人类视觉本质上是主观的和身份驱动的,而现有的 MLLM 为一般任务提取客观的、与字符无关的特征。在 RPA 中,这种通用的视觉噪声压倒了脆弱的角色特征,导致模态角色干扰 (MRI),代理很难将视觉基础和角色一致性整合起来。为了解决这个问题,我们引入了 无需训练 角色感知视觉干预 (CAVI) 框架,使代理能够通过角色的镜头感知世界。 CAVI 系统地针对 MRI:宏观上,字符引导标记修剪(CTP)将视觉感受野限制为角色相关的实体;微观上,正交特征调制(OFM)将标记投影到字符上下文子空间上以提取对齐的事实;在解码过程中,模态自适应角色转向(MARS)根据视觉依赖动态优化转向强度。大量实验表明,CAVI 有效减轻了 MRI 的影响,显着增强了字符一致的多模态交互。