论文

综合专家:经过验证的多模式数据集,用于值得信赖的人工智能辅助游泳教练

Synthesizing the Expert: A Validated Multimodal Dataset for Trustworthy AI-Assisted Swimming Coaching

模型训练合成数据

摘要

这项研究主要关注为游泳领域的高级人工智能应用合成结构化检索增强生成(RAG)系统的关键问题。随着人工智能与运动科学的融合日趋成熟,其在游泳领域的应用也越来越多样化,从实时技术指导和人才发掘,到综合表现分析和训练周期的动态个性化。在此背景下,基于 RAG 的系统代表了 大语言模型 (LLM) 增强游泳分析的关键进步,因为它们允许以权威领域知识为基础生成输出,从而确保人工智能生成的建议在上下文和技术上的可信度。尽管具有这种潜力,但仅使用真实世界水生数据构建强大的 RAG 系统仍面临重大挑战,包括运动员生物识别方面的道德限制以及手动专家标记的高成本。为了解决这些障碍,我们提出了一种新颖的生成框架,该框架利用跨四个维度收集的多模态知识库:生理数据、生理文献、运动传感器数据和非结构化领域专业知识。我们提出的框架利用多代理 LLM 架构来合成一个高保真数据集,其中包含 1,864 个经过验证的“问题-上下文-答案”三元组,这些数据集是根据 12 个生理健全性规则评估的 1,914 个草稿得出的。通过提供结构化的合成 真值,这项工作为水生领域值得信赖的人工智能建立了基础基准。这项研究的成果有望提高自动教练的可靠性,并为“元代理”开发和运动分析开辟大量未来方向,最终弥合原始数据工程和实际运动科学应用之间的差距。