论文

MedCode:用嵌入代码和加权偏好优化改善医学计算

Improving Medical Calculation of LLMs with Embedded Coding

模型训练偏好优化

摘要

大语言模型在医学考试与问答基准上表现较好,但在需要精确数值输出的医学计算任务中仍不可靠。这些计算支持用药剂量、器官功能评估和预后评分等高风险决策,即使小误差也可能产生严重临床后果。我们提出MedCode,通过训练LLM生成嵌入式可执行代码来改善医学计算。给定临床上下文,模型识别相关计算器、提取输入变量并生成脚本,将算术运算交给确定性解释器。脚本执行返回计算值、解释和适当单位。我们依据MedCalc基准构建监督微调和偏好数据集,并另行整理重症监护场景的计算数据集。我们还提出加权直接偏好优化(wDPO),自适应强调模型难以区分的偏好对。在LLaMA3-8B、Qwen2.5-7B和Mistral-7B上的实验显示,准确率绝对提高20至30个百分点,表明嵌入代码生成能有效改善医学计算。