论文
AVTrace:诊断 Omni 模型中的视听时间推理
AVTrace: Diagnosing Audio-Visual Temporal Reasoning in Omni Models
摘要
Omni模型可以描述视频内容,但能否及时定位事件、保持事件顺序、判断视听同步?我们介绍 AVTrace(视听时间推理评估和能力评估),这是一个银标准诊断套件,涵盖事件起点与时间范围定位、同步、下一步预测、跨模态定位、链解析和事件条件理解。它包含 34,114 个训练示例以及 3,500 个和 7,000 个示例的类别平衡开发和测试部分。我们使用参考盲响应归一化和确定性评分在各自的输入配置下评估五个开放全向模型。所有五个现成系统在同步验证方面的得分都低于测试分片的多数标签基线 0.556,并且在链解析和事件条件定位和理解方面得分较低。开发集扰动揭示了 Qwen3-Omni-30B 对模态去除和视觉输入处理变化的任务依赖性敏感性,而没有隔离其根本原因。参数高效的时间后训练在多个基准指标上改进了 Gemma4-E4B-it。在三个外部图像基准上,任务指标略有变化,包括一些退化,而教师的困惑度则减少了。总之,这些发现表明,语义参考文本重叠不应被视为时间本地化的代理,并且 AVTrace 可以识别特定于任务的弱点,同时为时间后训练提供测试平台。