论文
面向可靠性的多语言骨科诊断:领域自适应建模和概念验证框架
Reliability-Oriented Multilingual Orthopedic Diagnosis: A Domain-Adaptive Modeling and a Conceptual Validation Framework
摘要
大语言模型 (LLM) 越来越多地被提议用于临床决策支持,包括资源匮乏环境中的多语言诊断。然而,对于结构化、高风险的任务,它们的可靠性、校准和安全特性仍然没有得到充分的了解。我们根据英语、印地语和旁遮普语的自由文本临床记录对多语言骨科诊断进行系统级分析。我们评估了三种建模机制:(i)任务对齐的多语言 Transformer 编码器,(ii)任务微调基线(DistilBERT),以及(iii)针对整形外科文本量身定制的领域自适应架构(IndicBERT-HPA)。这些模型与零样本、指令调整的 LLM 进行比较,以评估结构化诊断分类的适用性。结果表明,虽然 LLM 表现出很强的语言流畅性,但在结构化多语言条件下,特别是在资源匮乏的语言中,它们表现出不稳定的校准和降低的可靠性。这些发现特定于零样本评估,并不意味着微调模型的局限性。领域自适应专业化极大地改善了跨语言歧视和信心行为。 IndicBERT-HPA 具有特定语言的矫形适配器头,可在六个诊断类别中实现始终如一的强大性能,并且比仅任务自适应具有更可预测的部署特性。基于这些观察,我们概述了一个概念性的基于确定性代理的验证框架,用于未来的实施、形式化证据检查、语言敏感验证和保守的人机循环门控。可靠的多语言临床决策支持需要专门的架构、明确的可靠性分析以及安全关键系统的结构化验证。