论文

KnowSim:用会学习的用户模拟器评估LLM助手的信息校准

KnowSim: Evaluating Information Calibration in LLM Assistants with User Simulators that Learn

模型评测评测方法与指标

摘要

为了在知识密集型任务中与用户有效协作,大语言模型(LLM)必须执行信息校准:使内容与用户不断演化的理解和认知能力相匹配。然而,用于评估和训练LLM的用户模拟器并未显式建模用户知识,因此既不能在不同知识水平上产生逼真的交互,也不能反映知识演化时交互如何展开。为弥合这一差距,我们提出KNOWSIM,一个围绕维护显式知识状态的用户模拟器构建的评估框架,该知识状态表示为带先修关系的信息单元图,并依据学习理论设定的更新规则演化。KNOWSIM直接从知识状态轨迹计算三个指标(知识增益、交付校准、认知过载),反映信息校准的关键机制层面。我们在两个领域、按知识水平分层的705次人机对话上验证KNOWSIM:其排序与人类判断显著一致(73-74%符号一致率),优于三个基线模拟器。应用于9个LLM时,KNOWSIM揭示最佳模型随用户知识水平而变化,揭示了标准评估看不见的能力-处理交互。

KnowSim:用会学习的用户模拟器评估LLM助手的信息校准:论文配图
图1:KnowSim 模拟两名知识水平不同的用户向同一助手提出同一医学问题。新手患者在第 1 轮毫无吸收(认知负荷超出容量),缓慢补足前置知识,最终收获有限且过载严重。前置知识已然具备的资深医生每轮吸收一个概念,在低过载下达到完全掌握。指标(KG、DC、CO)直接由不断演化的知识状态计算得出,解释了为何同一回复对一名用户有帮助却令另一名用户不堪重负。