论文
一种以人为本的LLM育儿建议基准评测方法
A Human-Centred Approach to Benchmarking LLMs for Parenting Advice
摘要
人们越来越多地使用大语言模型(LLM)寻求建议,包括育儿建议。育儿是一个关键且社会敏感的领域,因此评估LLM提供的建议需要超越汇总式信息质量基准的指标,以考虑回复中的关系与行为要素。本文使用由育儿专家创建的多维评分量表,以LLM-as-a-judge方法在英语与中文两种语言下、跨100个育儿场景评估了15个LLM。结果显示:汇总分数可能掩盖量表条目层面的具体弱点;不同模型会隐性地鼓励不同的育儿风格;语言也会影响回复。我们强调评估输出可审计性的重要性,以及在育儿等领域评估LLM生成建议所涉及的挑战。我们的发现为选择用于直接用户交互的LLM以及开发面向用户的育儿建议应用提供了重要洞见。
