论文

测试黑匣子:独立评估面向消费者的健康的结构性障碍 LLM

Testing the Black Box: Structural Barriers to Independent Evaluation of Consumer-Facing Health LLMs

模型评测评测方法与指标

摘要

背景:面向消费者的 大语言模型 现在是健康信息的常见来源,它们解释和个性化响应而不是检索它们。他们的反应是否因用户而异是一个临床、公平和治理问题,有证据表明阿谀奉承的反应可以改变判断并增加信任,这一问题变得更加尖锐。目的:评估在类似于普通患者使用的条件下面向消费者的健康 LLM 的响应变化和阿谀奉承。方法:我们借鉴将社会背景与健康态度联系起来的文献,构建了在地理位置、浏览环境、表达的信仰和健康的社会决定因素方面不同的模拟用户档案。我们将经过验证的工具(包括疫苗接种态度检查量表和生殖态度量表)改编成多轮提示,旨在引发用户之间具有临床意义的变化。结果:评估遇到了五个相关障碍。事实提示产生了稳定的反应,掩盖了多轮对话中出现的阿谀奉承。基于浏览器的界面没有透露哪些信号影响输出,并且无法重置为干净的基线。大规模测试受到服务条款、速率限制和机器人检测的限制。基于准确性的标准无法捕获语气、框架或遗漏,并且 LLM 作为判断方法存在共同对齐偏差的风险。模型更改时没有可追踪的版本标识符,从而妨碍了可靠的复制。结论:目前尚不存在可靠的独立评估框架来检查面向消费者的健康 LLM 在日常使用中的表现。监督需要披露个性化信号、稳定版本标识符、研究人员安全港计划以及对健康相关输出的部署后监控。