论文

OmniReasoner:通过本机工具使用长音频-视频进行思考

OmniReasoner: Thinking with Long Audio-Video via Native Tool Use

智能体系统Agent 工具调用

摘要

对于全模态 LLM 来说,长时间的音频-视频推理很困难,因为决定性的证据通常是稀疏的、跨模态的,并且用统一的高保真输入保存起来成本太高。我们引入了 OmniReasoner,一个用于长音频-视频思考的工具使用 后训练 框架:全模态 LLM 学习,通过监督 微调 和强化学习,决定在回答之前是否以及在哪里调用放大工具。 OmniReasoner 首先构建完整流的低成本全局预览,然后在需要时调用具有请求时间间隔的放大工具,以便在应答之前进行更高保真度的视觉和音频检查。因为模型在此调用之前和之后观察到不同的采样粒度(稀疏的全局预览和更密集的本地剪辑),所以我们引入了 TimeAnchor,它使工具的时间参数在这些粒度上保持有效和往返一致,而不是与特定采样率的帧索引相关联。为了使这种工具使用行为无需昂贵的手动间隔注释即可训练,我们构建了一个时间增强数据引擎,通过视频编辑和合成来合成工具使用 后训练 轨迹。全模态和视频基准测试表明,OmniReasoner 提高了答案准确性和时间基础,同时将高保真计算集中在信息区域。代码可在 https://github.com/RockyChen0205/OmniReasoner 获取。