论文
ShutterMuse:使用 MLLM 进行拍摄时摄影指导
ShutterMuse: Capture-Time Photography Guidance with MLLMs
摘要
现实世界的摄影需要对相机取景和拍摄对象姿势进行拍摄时指导。然而,现有的美学裁剪基准主要评估事后裁剪预测,而忽略了主体侧建议,从而使多模态 大语言模型 (MLLM) 的捕获时间指导能力尚未得到充分探索。为了解决这一差距,我们引入了 CaptureGuide-Bench,这是一个具有两个互补任务的基准:摄影师端构图决策和细化,以及主体端场景条件姿势推荐。我们的评估揭示了局限性:通用 MLLM 可以做出构图决策,但缺乏精确的细化定位,而专门的美学裁剪模型可以有效地定位作物,但仅限于细化;两者都没有提供可操作的姿势指导。为了支持模型开发,我们进一步构建了 CaptureGuide-Dataset,其中包含 130K 个具有文本原理和结构化视觉注释的样本,并开发了 ShutterMuse,这是一个经过监督和强化 微调 训练的统一 MLLM。 CaptureGuide-Bench 上的实验表明,ShutterMuse 在评估的基线和有竞争力的主体侧姿势推荐中实现了最佳的整体摄影师侧性能,并且推理成本显着降低,这证明了 MLLM 作为图像捕捉过程中摄影交互式助手的潜力。