论文

CueRator:搜索符号规则以适配冻结多模态编码器

CueRator: Agentic Search for Symbolic Rules to Adapt Frozen Multimodal Encoders

智能体系统Agent 规划

摘要

大语言模型智能体已用于搜索符号结构,例如程序和方程。我们提出了 CueRator,一个用于策略感知决策规则发现的 Agentic 框架,它通过搜索将跨模态相似性转换为预测的决策规则来适应冻结对比多模态编码器。我们在开放词汇视听事件感知上对其进行验证,其中现有方法涉及对未见类别的适应性和泛化之间的权衡:训练有素的模块以泛化为代价进行适应,而固定规则则相反。该框架将用于泛化的符号公式与轻量级策略配对,该轻量级策略可以预测每个视频的参数以实现自适应。报告引导的多智能体循环离线发现公式,评估每个候选者的表达上限以及经过训练的策略是否可以实现它。在 OV-AVEBench 上,与现有最佳方法相比,CueRator 将总平均值从 57.8 提高到 60.2,将未见类别性能从 55.8 提高到 59.9,将已见未见类别的差距从 7.1 缩小到 1.2。 消融 将增益归因于公式和策略,并表明这两个反馈信号对于有效搜索都是必要的。 CueRator 还改进了另外两个视听事件感知任务的各自基线,并且发现的规则在仅重新训练策略的编码器中仍然具有竞争力。代码可在 https://github.com/cvsp-lab/cuerator. 获取

CueRator:搜索符号规则以适配冻结多模态编码器:论文原图
图 1:CueRator 报告引导的 Agentic 搜索概述。在每次迭代中,计划智能体根据累积报告设置搜索方向,设计智能体提出针对形式约束进行验证的可执行公式,Oracle 和策略智能体 评估候选方案的执行情况以及其参数是否可以学习。 Oracle 智能体通过每个视频的参数搜索和 消融 来估计表达上限,而策略网络则为候选者进行训练并由策略智能体 进行诊断。所有报告都附加到记忆以供下一次迭代;测试时不使用LLM 智能体。