论文

一种以人为本的LLM育儿建议基准评测方法

A Human-Centred Approach to Benchmarking LLMs for Parenting Advice

模型评测基准与评测资源

摘要

人们越来越多地使用大语言模型(LLM)寻求建议,包括育儿建议。育儿是一个关键且社会敏感的领域,因此评估LLM提供的建议需要超越汇总式信息质量基准的指标,以考虑回复中的关系与行为要素。本文使用由育儿专家创建的多维评分量表,以LLM-as-a-judge方法在英语与中文两种语言下、跨100个育儿场景评估了15个LLM。结果显示:汇总分数可能掩盖量表条目层面的具体弱点;不同模型会隐性地鼓励不同的育儿风格;语言也会影响回复。我们强调评估输出可审计性的重要性,以及在育儿等领域评估LLM生成建议所涉及的挑战。我们的发现为选择用于直接用户交互的LLM以及开发面向用户的育儿建议应用提供了重要洞见。

一种以人为本的LLM育儿建议基准评测方法:论文配图
图2:各模型在各个场景上的总体分数分布。主评审 = GPT-5.2