论文
CueRator:搜索符号规则以适配冻结多模态编码器
CueRator: Agentic Search for Symbolic Rules to Adapt Frozen Multimodal Encoders
摘要
大语言模型智能体已用于搜索符号结构,例如程序和方程。我们提出了 CueRator,一个用于策略感知决策规则发现的 Agentic 框架,它通过搜索将跨模态相似性转换为预测的决策规则来适应冻结对比多模态编码器。我们在开放词汇视听事件感知上对其进行验证,其中现有方法涉及对未见类别的适应性和泛化之间的权衡:训练有素的模块以泛化为代价进行适应,而固定规则则相反。该框架将用于泛化的符号公式与轻量级策略配对,该轻量级策略可以预测每个视频的参数以实现自适应。报告引导的多智能体循环离线发现公式,评估每个候选者的表达上限以及经过训练的策略是否可以实现它。在 OV-AVEBench 上,与现有最佳方法相比,CueRator 将总平均值从 57.8 提高到 60.2,将未见类别性能从 55.8 提高到 59.9,将已见未见类别的差距从 7.1 缩小到 1.2。 消融 将增益归因于公式和策略,并表明这两个反馈信号对于有效搜索都是必要的。 CueRator 还改进了另外两个视听事件感知任务的各自基线,并且发现的规则在仅重新训练策略的编码器中仍然具有竞争力。代码可在 https://github.com/cvsp-lab/cuerator. 获取
