论文
社交视听问答推理:我们站在哪里?
Reasoning for Social Audio-Visual Question Answering: Where Do We Stand?
摘要
训练多模态 大语言模型 进行视听社交理解是迈向具身社交智能的关键一步。思想链 (CoT) 推理已成为主流方法,其中 HumanOmniV2 及其 IntentBench 基准测试作为突出的参考点。在这种情况下,我们报告三项发现。首先,IntentBench 噪音很大:$\sim$7% 的问题被破坏,$\sim$23% 在没有视频输入的情况下可以轻松回答。我们删除了受影响的问题并发布了 Intentbench-Prime。其次,当前的推理方法成本高昂,而且效率低得惊人。一个简单的 Vanilla SFT 基线在三个基准上可以与现有的推理方法相匹配或优于现有的推理方法,而成本却只有一小部分,从而将其确立为评估新颖的 微调 技术的基本基线。第三,我们的分析表明,大量先验可以仅从文本模态中学习,并且使用文本标题而不是视频可以获得与 Vanilla SFT 相当的性能。这些令人惊讶的发现揭示了当前 MLLM 在社会理解方面的局限性。 IntentBench-Prime、Vanilla SFT 模型和代码是公开的。