论文
KnowSim:用会学习的用户模拟器评估LLM助手的信息校准
KnowSim: Evaluating Information Calibration in LLM Assistants with User Simulators that Learn
摘要
为了在知识密集型任务中与用户有效协作,大语言模型(LLM)必须执行信息校准:使内容与用户不断演化的理解和认知能力相匹配。然而,用于评估和训练LLM的用户模拟器并未显式建模用户知识,因此既不能在不同知识水平上产生逼真的交互,也不能反映知识演化时交互如何展开。为弥合这一差距,我们提出KNOWSIM,一个围绕维护显式知识状态的用户模拟器构建的评估框架,该知识状态表示为带先修关系的信息单元图,并依据学习理论设定的更新规则演化。KNOWSIM直接从知识状态轨迹计算三个指标(知识增益、交付校准、认知过载),反映信息校准的关键机制层面。我们在两个领域、按知识水平分层的705次人机对话上验证KNOWSIM:其排序与人类判断显著一致(73-74%符号一致率),优于三个基线模拟器。应用于9个LLM时,KNOWSIM揭示最佳模型随用户知识水平而变化,揭示了标准评估看不见的能力-处理交互。
