论文

我可以再服用一剂吗?评估 OTC 剂量 QA 中时间不确定性下的 LLM 决策

Can I Take Another Dose? Evaluating LLM Decision-Making Under Temporal Uncertainty in OTC Dosing QA

模型评测基准与评测资源

摘要

大语言模型 (LLM) 越来越多地用于日常健康问题,包括用户是否可以安全地服用另一剂非处方 (OTC) 药物。然而,在现有的医学 QA 评估中,这种常见的安全相关设置仍未得到充分探索,正确的答案需要跟踪剂量时间、计算滚动 24 小时摄入量、遵循产品标签限制以及处理不完整的用药历史。我们推出了 DOSEBENCH,这是一个针对 81 个精选 OTC 剂量场景的集中基准,重点关注成人对乙酰氨基酚和布洛芬的使用,并带有手动注释的人工标注参照。我们使用决策正确性、一致性、解释可验证性、故障类型和置信度相关信号的指标,在​​重复运行中评估了四个 LLM,从而产生了 1,620 个模型响应。我们的结果表明,模型经常与滚动窗口推理和模糊性敏感的情况作斗争,并且稳定或看起来自信的响应仍然可能违反剂量限制。这些发现表明,OTC 剂量 QA 为评估医学 QA 中的时间推理、约束遵循和安全相关的不确定性处理提供了一个狭窄但实用的测试平台。