论文
AI生成运动处方的一致性:一项使用大语言模型的重复生成研究
Consistency of AI-Generated Exercise Prescriptions: A Repeated Generation Study Using a Large Language Model
摘要
背景:大语言模型(LLM)已被探索用于生成个性化运动处方,但相同条件下输出的一致性仍研究不足。目的:本研究采用重复生成设计评估LLM生成运动处方的模型内一致性。方法:使用六个临床场景以Gemini 2.5 Flash生成运动处方(每个场景20份输出,总计n=120)。一致性从三个维度评估:(1) 基于SBERT余弦相似度的语义一致性;(2) 采用AI-as-a-judge方法、基于FITT原则的结构一致性;(3) 安全表述一致性,包括纳入率与句子级量化。结果:各场景语义相似度均较高(平均余弦相似度0.879-0.939),临床约束较强的场景一致性更高。频率表现出一致的模式,而定量成分存在变异,尤其是运动强度。10-25%的抗阻训练输出中出现无法归类的强度表述。100%的输出包含安全相关表述,但安全句数在各场景间差异显著(H=86.18,p小于0.001),临床病例比健康成人病例生成更多安全表述。结论:LLM生成的运动处方语义一致性高,但关键定量成分存在变异。可靠性在很大程度上取决于提示结构,在临床部署前还需要额外的结构约束与专家验证。