论文
GigaChat Audio:时间感知大型音频语言模型
GigaChat Audio: Time-aware Large Audio Language Model
摘要
对于经过音频调节的 LLM 来说,长录音中的时间定位仍然具有挑战性。我们提出了一个时间感知音频 LLM,它可以在长达 120 分钟的输入中回答具有明确时间戳的问题。我们的方法使用级联管道的大规模合成监督,将周期性时间标记与连续音频词元交织在一起。我们的模型在短期和长期基准上实现了强大的时间定位准确性,并支持时间锚定的片段描述和摘要。广泛的消融检查时间表示、标记频率、标记化和持续时间混合设计如何影响准确性和计算成本。我们发布了模型权重和数据集,以支持对时间感知音频理解的进一步研究,请访问 https://huggingface.co/ai-sage/GigaChat3.1-Audio-10B-A1.8B。