论文

ArogyaSutra:印度语言多模态医学推理的多智能体框架

ArogyaSutra: A Multi-Agent Framework for Multimodal Medical Reasoning in Indic Languages

智能体系统Agent 协作

摘要

多模态 大语言模型 (MLLM) 在一般领域表现出了有前景的推理能力,但其性能在医疗保健等专业环境中仍然有限,特别是在多语言和资源匮乏的场景中。这种差距在印度农村等地区至关重要,那里的患者经常用印度本土语言表达复杂的医疗查询,并依赖医学图像等多模式输入。现有以英语为中心的 MLLM 很难支持此类用例,从而限制了获得人工智能驱动的医疗保健援助的公平机会。为了应对这一挑战,我们引入了 ArogyaBodha,这是一个由 8 个异构源构建的大规模多语言多模式医学问答数据集,涵盖英语和七种主要印度语言的 31 个身体系统、六种成像模式和 21 个临床领域。我们进一步提出了 ArogyaSutra,一种基于策略—价值评估的多智能体框架,它将以工具证据为依据与双记忆机制相结合,以进行逐步的、推理感知的决策,并使用存储的策略—价值评估模拟轨迹进行 蒸馏。实验表明,我们的数据集和框架提高了所有印度语言的多语言医学推理准确性,并通过消融验证了每个组件的贡献。源代码和数据集位于:https://iitp-cse.github.io/ArogyaSutra/