论文

PIXELRAG:网页截图击败文本以实现检索增强生成

PIXELRAG: Web Screenshots Beat Text for Retrieval-Augmented Generation

上下文与知识检索增强

摘要

使用检索到的 Web 文本增强 大语言模型 (LLM) 已成为主导范例,但 Web 本身并不是文本的:现有系统依赖于复杂的解析管道,这些管道将 HTML 线性化并丢弃布局、视觉结构和格式。我们引入了 PixelRAG,这是一种新的检索增强方法,它以其原生视觉形式表示网站,并完全在像素空间中执行检索和阅读,从而实现消除文本抽象的端到端架构。据我们所知,PixelRAG 是第一个以这种形式对完整维基百科语料库进行操作的管道,可扩展至包含 3000 万张屏幕截图图像的数据存储,并具有高效的视觉检索索引。 PixelRAG 基于现有的视觉嵌入模型(即 Qwen3-VL-Embedding)构建,通过精心策划的对比训练数据在屏幕截图数据上进一步微调该模型。然后,检索到的屏幕截图将作为像素输入直接馈送到 VLM,无需中间文本转换。 PixelRAG 始终优于无检索和基于文本的 RAG 基线,最令人惊讶的是在广泛研究的以文本为中心的任务(例如 NQ 和 SimpleQA)上。它还在多模式开放域 QA(例如 MMSearch)、嘈杂新闻语料库基准(例如 LiveVQA)和代理基准(例如 MoNaCo)方面取得了巨大进步,与基于文本的基准相比,准确率提高了 18.1%。最后,像素表示通过图像压缩为 RAG 提供了新的效率杠杆,在较低分辨率下实现高达 3 倍的词元成本降低,同时保持准确性。我们的结果挑战了网络检索中文本表示的必要性,表明网络 RAG 可以直接以网络的本机视觉形式运行,同时提高性能和效率。