论文
大语言模型在化妆品化学与皮肤健康中的准确性与可靠性:一项基准研究
Accuracy and Reliability of Large Language Models in Cosmetic Chemistry and Skin Health: A Benchmarking Study
摘要
随着消费者日益转向AI聊天机器人获取护肤建议,大语言模型(LLM)在化妆品化学方面的技术准确性在很大程度上仍未被评估。我们在一组与化妆品化学相关的结构化主题上对14个LLM进行基准测试,包括特定化妆品成分的化学性质以及消费者可能感兴趣的常见化妆品场景。全程禁用网页搜索,以评估每个模型的内化知识而非其互联网检索能力。总体表现不佳,最明显的短板出现在定量推理与结构识别任务上。虽然模型对一般性护肤问题的回答尚属合理,但回复始终缺乏帮助消费者做出知情决策所需的技术深度。值得注意的是,与AI对话可能构成风险:听起来权威但含技术错误的输出,比明确承认不确定性的回复更不容易引发用户的怀疑。这些发现表明,主要在未经验证的公开数据上训练的通用LLM目前并不是可靠的化妆品化学信息来源。可能需要两方面的进展——用经验证的化学与皮肤病学数据集做微调,以及算法推理的大幅改进——这些工具才能被视为可供公众使用的资源。
