论文

推理时间代理决策规则击败了多图像医学推理的长期进化搜索

Inference-Time Agentic Decision Rules Beat Longer Evolving Search for Multi-Image Medical Reasoning

模型推理推理验证与自校正

摘要

多图像医学 VQA 不仅仅是一个提示长度问题;这是代理决策的一个根本挑战。医学视觉语言代理必须在有序图像中汇总证据,对答案顺序扰动保持鲁棒性,并避免过度拟合嘈杂的搜索时间反馈。我们通过对五种推理时间代理策略的受控比较来研究 MedFrameQA,使用相同的高预算 ShinkaEvolve 配置进行优化,并在可重复的内部冻结分裂(1,331 个进化、665 个保留、855 个最终测试)上进行评估。经过五次独立的重复运行,最强的方法成为最简单的鲁棒聚合器:\textbf{order-vote} 策略实现了 $57.89 \pm 0.65\%$ 最终测试精度,显着优于固定基线 ($52.73 \pm 0.42\%$) 和更复杂但脆弱的排序重新排序变体 ($55.79 \pm 0.43\%$)。配对引导分析证实了这些显着的收益。将进化搜索预算从 50 代扩展到 100 代不会产生泛化优势:虽然保留性能略有提高,但最终测试精度从 $57.89\%$ 下降到 $56.02\%$。我们的研究结果表明,对于多图像医学推理,定义正确的代理决策规则比扩大优化搜索预算更有效。