编辑器内部的相机:使用绘制的校准图案读取图像编辑器的隐式相机
The Camera Inside the Editor: Reading the Implicit Camera of Image Editors with Painted Calibration Patterns
摘要
基于指令的图像编辑器插入对象、重新设计场景并渲染新的视点,但未知他们在绘制照片时使用哪个相机。一名编辑被要求用棋盘覆盖地板,在没有任何训练的情况下绘制射影结构,经典的消失点几何学从中读取俯仰、滚动、焦距、偏航以及渲染上的主点。与 GeoCalib 等估计图像相机的校准器不同,它隔离了编辑器在其下绘画的相机。在具有精确地面实况的 120 个渲染相机上,Qwen-Image-Edit-2511 绘制在 0.26 度内与消失点相交的图块边缘,其隐式相机与真实相机的俯仰角匹配为 0.8 度,焦距匹配为 6%,除了滚动之外,比 GeoCalib 更准确。当被要求绘制地平线或标记消失点时,编辑器失败了,因此这些知识是通过绘画而不是通过我们尝试的明确任务来揭示的。隐式相机有两个先验:滚动被拉向水平(斜率 0.71),长焦视角默认约为 30 毫米,这与模型在没有任何场景的情况下绘制的相机大致匹配。对于 Qwen 来说,当模糊消除了五分之四的线条证据时,先验不会增长。它们在真实照片上更强,而在 NYUv2 上,任务的较短措辞消除了滚动的差异。在使用 24--240 毫米变焦镜头拍摄的照片中,绘制的透视图仅随着镜头斜率的 0.62 而增长,而 GeoCalib 和 MoGe-2 在大约 52 和 42 毫米时饱和。 FLUX.1 Kontext 和 LongCat-Image-Edit 的拉动要困难得多。最后,在水平相机上,相机控制 LoRA 仅以其强度的 50--70% 执行姿势命令,并且绘制在其输出中的板与它生成的相机一致。