论文
TEMA:多轮多音频对话中的循证时间问答
TEMA: Evidence-Grounded Temporal Question Answering in Multi-Turn Multi-Audio Dialogs
摘要
多轮、多音频时间问答需要模型跟踪后续问题、记录开关和历史参考中的目标事件,恢复完整的实例及其边界以进行时间计算和比较。我们提出 TEMA,它通过 Route(指定音频范围)和 Span(将所有相关间隔描述为条件音频字幕)将事件感知与基于证据的回答连接起来。我们构建了具有 40,704 个对话以及每轮证据和答案监督的 TEMA-Dialog,以及用于联合评估证据和最终答案的 TEMA-Bench。训练结合了时间基础初始化、全对话监督微调和完整性优先的仅限 Span 的 GRPO。 Qwen2.5-Omni 和 AF-Next 上的实验显示了时间问答的改进,特别是事件定位和跨音频比较。仅应用于证据的强化学习进一步提高了间隔恢复和答案准确性。