论文
ShotCrop$^3$:将以人为中心的图像裁剪成电影三镜头组合
ShotCrop$^3$: Cropping Human-Centric Images into Cinematic Triple-Shot Compositions
摘要
先前关于美学构图的工作通常会产生单一的美观的作物,而忽视了从一个场景组合多个镜头的叙事价值。在实践中,多镜头构图对于下游创意工作流程至关重要:商业海报通常需要具有不同重点(例如背景、主题和情感/产品细节)的多种裁剪来呈现关键的故事节拍。因此,我们提出了 \textbf{三镜头合成(TSC)},这是一种合成任务,可以从单个以人为中心的图像生成三镜头集——立场、中景和特写,每个镜头都配有简短的镜头描述以支持视觉叙事。为了在有限的专家注释下学习 TSC,我们引入了 \textbf{ShotCrop},它经历了三个阶段的训练过程:首先应用 Chain-of-Thought 监督的 微调 建立基本推理和审美镜头裁剪技能,然后使用高置信度伪标签执行半监督 微调 进一步增强审美能力,最后通过组相对策略优化进行优化\textbf{ShotCrop} (GRPO-S) 使用为其量身定制的复合奖励。具体来说,我们的伪标记策略结合了基于 MLLM 的评分、美学评估和 CLIP 相似性,以保留高置信度的训练信号。此外,我们还推出了 TSC-Bench,这是 1.2k 个专家注释测试用例的基准测试。值得注意的是,ShotCrop 在镜头定位精度方面比 GPT-5 平均提高了 \textbf{2.82} 倍。