论文
SketchVLM:视觉语言模型可以注释图像以解释想法并指导用户
SketchVLM: Vision language models can annotate images to explain thoughts and guide users
摘要
当回答有关图像的问题时,人类会自然地指出、标记和绘画来解释他们的推理。相比之下,Gemini-3-Pro 和 GPT-5 等现代视觉语言模型 (VLM) 仅以文本响应,用户很难验证。我们提出了 SketchVLM,这是一个 无需训练 模型无关的框架,它使 VLM 能够在输入图像上生成非破坏性的、可编辑的 SVG 叠加层,以直观地解释他们的答案。在涵盖视觉推理(迷宫导航、球落下轨迹预测和对象计数)和绘图(零件标记、连接点和围绕对象绘制形状)的七个基准测试中,相对于图像编辑和微调草图基线,SketchVLM 将视觉推理任务准确性提高了 28.5 个百分点,注释质量提高了 1.48 倍,同时还生成了更忠实于模型规定答案的注释。我们发现单轮生成已经实现了很高的准确性和注释质量,而多轮生成为人类与人工智能的协作开辟了更多机会。交互式演示和代码位于 https://sketchvlm.github.io/。