论文
AI 生成的运动处方的跨模型一致性:跨三个 大语言模型 的重复生成研究
Cross-Model Consistency of AI-Generated Exercise Prescriptions: A Repeated Generation Study Across Three Large Language Models
摘要
本研究比较了温度 = 0 条件下三个 大语言模型 (LLM)(特别是 GPT-4.1、Claude Sonnet 4.6 和 Gemini 2.5 Flash)的运动处方输出的重复生成一致性。每个模型针对六种临床场景生成处方 20 次,产生 360 个总输出,在四个维度进行分析:语义相似性、输出再现性、FITT 分类和安全性表达。 GPT-4.1 的平均语义相似度最高 (0.955),其次是 Gemini 2.5 Flash (0.950) 和 Claude Sonnet 4.6 (0.903),并确认了显着的模型间差异 (H = 458.41,p < .001)。重要的是,这些分数反映了根本不同的生成行为:GPT-4.1 产生了具有稳定语义内容的完全独特的输出(100%),而 Gemini 2.5 Flash 显示出明显的输出重复(27.5% 的独特输出),表明其高相似性分数源自文本重复而不是一致的推理。因此,相同的解码设置产生了根本不同的一致性配置文件,这是单输出评估无法捕获的区别。所有型号的安全表达都达到了上限,证实了其作为差异化指标的实用性有限。这些结果表明,模型选择构成了临床决策而不仅仅是技术决策,并且重复生成条件下的输出行为应被视为可靠部署基于 LLM 的运动处方系统的核心标准。