论文

MBA:面向真实商业创意的多模态基准与智能体

MBA: Multimodal Benchmark and Agents for Real-World Business Ideation

模型评测基准与评测资源

摘要

由大语言模型(LLM)驱动的agentic系统为商业创意开辟了新机会。然而,尽管现实世界情境本质上多模态,现有方法仍局限于纯文本范式。因此我们提出MBA-Bench,首个用于训练与评估商业创意智能体的多模态基准,包含横跨六个领域的30K样本,每个领域都具有仅凭文本无法完全传达的独特视觉线索。具体而言,我们自动生成图像描述,并通过检索查询生成、市场证据检索和证据增强合成,用GPT-4o为三个商业问题各生成五个参考创意。遵循先前工作,我们使用MLLM-as-a-Judge沿六项商业导向标准评估智能体。为考虑标准隐藏或公开的设定,我们提出MBA-b与MBA-k,分别对应盲设与已知设定。我们用两种新奖励目标——创造力与可行性——训练两者,MBA-k进一步优化六项公开标准,共八项。两者均通过基于LoRA的监督微调加上带这些设定特定奖励的组相对策略优化来训练。在MBA-Bench的大量实验中,我们设置了分别只接受描述或多模态输入的两个基线,后者在若干指标上接近闭源性能。MBA-b与MBA-k分别超越描述基线63.9%与77.1%,超越多模态基线25.6%与35.8%。

MBA:面向真实商业创意的多模态基准与智能体:论文配图
图3:MBA 概览。(a) 我们提出 MBA-Bench,包含跨六个领域的 3 万个图像–字幕–问题–创意四元组,通过使用 GPT-4o 和 DuckDuckGo 的三步协议整理而成。(b) 随后我们通过 SFT 在问题–创意对上对基础 MLLM 进行指令微调。(c) 我们进一步利用 GRPO 结合特定设置的排序奖励来精调 SFT 检查点——对盲智能体 MBA-b 使用创造力与可行性,对已知智能体 MBA-k 使用六个已披露维度。