论文

RVLM:具有自适应深度的递归视觉语言模型

RVLM: Recursive Vision-Language Models with Adaptive Depth

模型推理测试时计算扩展

摘要

医疗人工智能系统面临两个基本限制。首先,传统的视觉语言模型(VLM)执行单遍推理,产生无法用临床术语审核或解释的黑盒预测。其次,公开中间步骤的迭代推理系统依赖于固定的迭代预算,在简单情况下浪费计算,同时为复杂情况提供不足的深度。我们通过统一的框架解决这两个限制。 RVLM 用迭代生成-执行循环取代单遍推理:在每一步,模型都会编写 Python 代码、调用视觉子代理、操作图像并积累证据。每个诊断声明都基于可执行代码,满足临床人工智能治理框架的可审核性要求。 RRouter 使迭代深度自适应:轻量级控制器根据任务复杂性特征预测最佳预算,然后监视进度并在推理停止时提前终止。我们使用 Gemini 2.5 Flash(不带 微调)对 BraTS 2023 脑膜瘤(脑部 MRI)和 MIMIC-CXR(胸部 X 射线)进行评估。在重复运行中,RVLM 在显着发现(例如质量存在和增强)上表现出高度一致性,并且可以检测流体衰减反转恢复 (FLAIR) 信号特征和分割边界之间的跨模式差异。在 MIMIC-CXR 上,它生成结构化报告并正确识别特定于视图的伪影。代码:https://github.com/nican2018/rvlm。