论文
超越正确性:混合思维 MLLM 中的基准测试和调整响应行为
Beyond Correctness: Benchmarking and Aligning Response Behaviors in Hybrid-Thinking MLLMs
摘要
混合思维多模态 大语言模型 (MLLM) 允许单个模型在深思熟虑的思维和延迟高效的非思维推理之间交替。尽管这些模式的推理预算不同,但它们提供的响应应该满足相同的面向用户的标准。仅正确性并不能表征这种响应质量;因此,我们评估任务准确性和响应模式失败作为补充结果。我们通过 \textbf{响应模式对齐}来研究这一差距:思考和非思考界面是否保留可接受的最终响应行为。我们引入了 \textbf{PatternEval},这是一种故障丰富的诊断基准,包含 2,415 个多模态提示,涵盖视觉感知和基础、结构化图像理解和多模态知识推理。 PatternEval 测试四种反复出现的失败:思想链泄漏、响应重复、逻辑矛盾和执行推理。响应模式失败在不同提供商的模型中普遍存在,非思考推理的失败率明显更高,从而在思考和非思考界面之间造成系统性错位。受此诊断的启发,我们开发了 \textbf{PatternRM}(一种响应级别奖励模型)和 \textbf{PatternRL}(它在强化学习期间引入了特定于模式的惩罚)。 Qwen3-VL-4B 和 Qwen3-VL-8B 上的实验表明,将特定于模式的惩罚纳入强化学习中可以减轻跨模式错位,同时产生边际任务性能权衡。 PatternEval 和 PatternRL 共同提供了一个评估和训练框架,用于跨混合思维界面调整用户可见的响应模式。