论文
ChatImage:通过交互式图像导航长格式 LLM 答案
ChatImage: Navigating Long-Form LLM Answers through Interactive Images
摘要
大语言模型 (LLM) 可以生成复杂查询的详细答案,但这些答案通常以密集的线性文本形式呈现,这使得细粒度的检查、导航和回访变得困难。我们推出了 ChatImage,这是一个将长格式 LLM 答案转换为交互式视觉图像的系统。给定文本答案,ChatImage 首先将其内容标准化为结构化视觉模块,规划视觉布局,并渲染连贯的图像。然后,它使用 LocateAnything 和 MiMo-Vision 等视觉定位模型(以及可选的 SAM 式掩模细化)对渲染图像应用第二个视觉定位步骤,以识别应支持交互的可见区域。从这些已定位区域,ChatImage 在图像上覆盖透明的可点击热点。每个热点都会打开一个详细信息面板和一个区域范围的后续线程,允许用户检查和查询答案的特定部分,而无需重新阅读完整的响应。 ChatImage 没有将计划的坐标视为最终的交互几何图形,而是将它们用作先验,并在渲染后定位交互目标,从而提高了视觉内容和可点击区域之间的一致性。我们发布了参考实现,并引入了包含 30 个问题的基准,涵盖信息图、地图和基于场景的答案格式。使用配置的外部模型进行评估会报告交互循环完成、严格的视觉对齐门和基于 SAM 的掩模完整性诊断。