论文
MMPostTrainBench:多模式后训练自主研究基准测试
MMPostTrainBench: Benchmarking Autonomous Research for Multimodal Post-Training
摘要
自主研究通过迭代实验和反馈寻求持续的模型改进。 LLM智能体在自动化机器学习和语言模型后训练方面显示出前景,但它们维持多模式改进的能力仍不清楚。我们推出了 MMPostTrainBench,这是一个涵盖图像、音频、视频、联合音视频理解和基于图像的软件修复等八项任务的基准测试。 智能体在固定预算内以通用基础模型运作,在对其提交的模型进行独立评估之前使用开发反馈。评估涵盖目标和非目标模型结果、迭代模型改进和选择以及研究完整性。在所有八项任务中,52.1% 的模型任务均值低于基准,并且评估的提交内容也表现出非目标回归。模型性能在研究迭代中并没有持续改善,并且智能体无法可靠地选择评估最佳的候选者进行提交;最终提交的内容落后该候选人高达 5.38 个百分点。将自主研究从纯文本扩展到多模态任务会引入额外的感知、跨模态对齐和时间定位方面的错误来源。观察到的回归和选择差距凸显了需要平衡有针对性的改进与非目标能力保留,并在研究迭代中保留收益。这些要求激发了 MMResearch,这是一个多模式研究框架,它将基于媒体的证据与假设和干预措施联系起来,通过分层记忆跨轮传递研究结果,并使用发展评估保留候选人。添加到现有的 code-智能体运行时中,它可以将使用 Claude Code 的 Claude Opus 4.8 提交的模型准确性提高高达 7.75 个百分点,将使用 Codex 的 GPT-5.6-sol 提高 2.33 个百分点。
