论文

RAPTOR+:基于视觉的视觉语言框架,可提高自动化癌症转诊处理中的临床信任和可审核性

RAPTOR+: A Visually Grounded Vision-Language Framework to Improve Clinical Trust and Auditability in Automated Cancer Referral Processing

模型评测基准与评测资源

摘要

紧急疑似结直肠癌 (CRC) 转诊会造成运营瓶颈,因为半结构化临床文件通常需要人工审核和转录。最初的 RAPTOR 系统使用 大语言模型 进行结构化提取,但依赖于单独的 OCR 阶段,使其容易受到手写、布局变化和视觉证据链接丢失的影响。我们推出了 RAPTOR+,这是一种多模式扩展,它使用视觉语言模型 (VLM) 进行端到端的转介理解。我们在 223 个临床策划的 CRC 紧急转诊表格上评估了微调的 VLM、商业和开源零样本 VLM 以及基于 OCR 的原始管道。我们还引入了一个证据定位感知评估框架,可以衡量提取准确性和证据本地化。结果显示零样本模型中存在明显的证据定位差距。 Gemini 2.5 Flash 的读取准确度达到 92.6%,但严格安全性仅为 1.2%。相比之下,经过微调的 Qwen3-VL-8B 实现了 96.1% 的读取准确度和 60.6% 的严格安全性,大大提高了可验证的证据基础。这些发现表明,特定任务的 微调 对于可靠、可审核的临床文档理解至关重要。 RAPTOR+ 能够将提取的转诊决策与视觉证据联系起来,支持更安全、更高效的癌症转诊分类。