倾听、推理和细分:使 LALM 与媒体章节化的编辑判断保持一致
Listen, Reason, and Segment: Aligning LALMs with Editorial Judgment for Media Chapterization
摘要
大型音频语言模型 (LALM) 在标准化基准方面取得了快速进展,但它们在实际媒体工作流程、管理、档案索引和内容分发中的部署在很大程度上仍未实现。我们将自动音频章节化(将连续音频流分割成主题连贯的章节的任务)视为暴露这一差距的一项要求严格且具有商业意义的设置。分章具有挑战性,因为边界不是由客观声学事件定义,而是由主观编辑判断定义,需要模型在长声学背景下顺序推理并近似创作者创作的边界决策。我们提出了 AudioChaps,这是一个 后训练 框架,用于通过思想链 (CoT) 推理指导的组相对策略优化 (GRPO) 来调整端到端 LALM 以完成此任务。为了支持训练和评估,我们策划了三个数据集:AudioChaps-Alignment,源自 YouTube 上创作者注释的章节边界; AudioChaps-CoT,为格式良好、高质量且基于证据的边界推理提供结构化监督;和 AudioChaps-Eval,一个音频章节化的持续基准。 AudioChaps-R1-Zero 直接应用 GRPO,无需受监督的 微调 (SFT) 冷启动,与最先进的 LALM Audio-Flamingo-3-Think 相比,平均 F1 提高了 33 个点。 AudioChaps 框架生成我们最终对齐的 LALM,AudioChaps-R1,它将平均 F1 提高了 49 点。这些结果表明,经过 GRPO 训练的 LALM 可以可靠地将非结构化听觉流转换为可导航的结构化媒体。我们的代码、模型和数据集资源将在接受后在 https://github.com/ta012/AudioChaps 上发布。