论文
解锁认知能力并分析感知-逻辑权衡
Unlocking Cognitive Capabilities and Analyzing the Perception-Logic Trade-off
摘要
多模态大语言模型(MLLM)的最新进展追求全感知能力,但把稳健的感官锚定与复杂推理相结合仍是挑战,对代表性不足的地区尤其如此。在本报告中,我们介绍MERaLiON2-Omni (Alpha)研究预览版,一个100亿参数、面向东南亚(SEA)的多语言全感知模型。我们提出一个渐进式训练流水线,显式解耦再整合“系统1”(感知)与“系统2”(推理)能力。首先,我们通过正交模态适配,把区域特定的视听线索(如Singlish语码转换、本地文化地标)与多语言LLM对齐,建立稳健的感知骨干。其次,为在没有大规模监督的情况下注入认知能力,我们提出高性价比的Generate-Judge-Refine流水线。通过利用Super-LLM过滤幻觉并经共识机制解决冲突,我们合成高质量银标注数据,把文本思维链推理迁移到多模态场景。在新推出的SEA-Omni基准套件上的综合评估揭示了一个效率-稳定性悖论:虽然推理是抽象任务的非线性放大器(显著提升数学与指令遵循性能),但它会给低层感官处理带来不稳定。具体而言,我们识别出长上下文音频中的时间漂移(Temporal Drift),即扩展推理使模型与声学时间戳脱同步;以及视觉过度解读(Visual Over-interpretation),即逻辑覆盖像素级现实。本报告详述架构、数据高效的训练配方,以及对稳健感知与结构化推理之间权衡的诊断分析。
