论文
面向临床语言模型的确定性数学求解器
Towards a Deterministic Math Solver for Clinical Language Models
摘要
LLM算术不可靠,而临床计算器中的一次数值错误可能改变建议。常规做法是逐个将计算器硬编码为验证函数。我们测试另一方案:模型不直接计算,而是生成病例专用Python,由受限本地执行器确定性求解,模型只决定如何使用工具。研究先按当前临床指南审计基准公式,在55个计算器中标记16个版本、用途或系数疑点,再用Qwen2.5-7B和Qwen2.5-32B-AWQ,在MedCalc-Bench Verified的1100病例、55计算器上比较Program-Solve、模型直接算术及手写22计算器库。当提供公式和标准变量且两种路径均阅读完整病历时,7B的工具收益不可靠:75.31%对72.02%,配对增加3.29个百分点,按计算器聚类的95%区间[−3.49,10.38]。32B则为90.53%对83.47%,增加7.05个百分点,区间[0.47,14.60]不含零。手写库在支持的440例完全准确,但其他情况弃权,整体为40.0%。即使公式、变量与病历访问条件匹配,执行器也对不同开放模型产生不同帮助,且不能替代可靠公式与变量提取。