论文
MLLM能解码创意跃迁吗?面向跨概念理解的C4评测框架
Can MLLMs Decode the Creative Leap? Introducing C4 for Cross-Concept Understanding
摘要
MLLM的创意能力在设计、传播、教育和人机协作中十分重要,但与面向准确率的任务相比,由于显式目标和奖励信号稀缺,其评估仍然困难。跨概念理解是接受性创造力(receptive creativity)的核心认知能力,它使感知者能够从非显而易见但有意义的概念关系中恢复意图含义。我们将条目构建操作化为跨概念编码,将模型推理操作化为跨概念解码。我们提出C4,一个受认知启发、面向基于成语(Chengyu)的跨概念创意的评估框架。其编码组件将目标槽位映射为人工标注并经第三方审核的跨概念网络中沿桥接路径的可意象化替代概念,由此支持具有显式结构的批量生成、以桥接数量与深度索引的难度,以及精确答案。利用该框架,我们构建了C4评估集(C4-Eval),包含184个合成条目和37个从在线来源收集的人工创作跨概念成语图像。我们为收集的图像人工构建并审核跨概念关系、桥接路径与推理过程。每个C4-Eval条目以五种任务设置实例化,共产生884个主要答案恢复案例。在被评估的十个MLLM中,最强的闭源模型分别达到50.7%与48.0%的主要准确率,而开源模型明显更低。候选约束能大幅提升准确率,但桥接提示与解释请求仅带来适度增益。这些结果揭示了当前MLLM在通过跨概念关系解码创意编码含义方面的显著差距。代码见补充材料。
