论文

审计的挑战:大型健康语言模型输出的可变性

Challenges of Auditing: Variability in Outputs of Large Language Models for Health

模型评测鲁棒性、公平性与可信度评测

摘要

人们越来越多地使用前沿人工智能模型来提供健康建议,但通过具有不同设置的不同访问模式(例如 ChatGPT、ChatGPT Health、API)。在这里,我们发现了不同访问模式之间的系统差异。由于评估通常依赖于 API,而消费者则通过聊天机器人界面进行交互,因此这些差异限制了评估的有效性。我们的研究结果强调,模型提供商迫切需要能够忠实地复制消费者体验和设置,以进行严格的审核。