论文

我们能信任AI推断的用户状态吗?验证运营环境中LLM用户状态分类可靠性的心理测量学框架

Can We Trust AI-Inferred User States. A Psychometric Framework for Validating the Reliability of Users States Classification by LLMs in Operational Environments

模型评测评测方法与指标

摘要

在对话与自适应系统中使用大语言模型评估用户状态,其前提是所用的评估指标在单个分数层面稳定且可解释。本文对这一假设进行实证检验,聚焦于人工智能(AI)用户状态测量的心理测量学可靠性。本研究采用重复评估程序,考察了一大批指标在三个不同的双模态大语言模型(GPT-4o audio、Gemini 2.0 Flash、Gemini 2.5 Flash)上的可重复性。分析既包括单分数可靠性,也包括聚合可靠性,从而可以区分出可能对实时自适应有用的指标与仅在聚合分析中保有价值的指标。结果表明,在解释性领域中,指标可靠性不能被视为默认属性。单分数层面缺乏稳定性,使得这类分数无法在实时自适应系统中被解读为用户状态指标,即便这些指标在聚合后表现出稳定性。与此同时,研究表明,单次测量不稳定的指标在事后研究中仍可保有分析价值,可用于识别支配交互的规则及其与满意度、信任度、投入度等用户体验参数的关系。本工作的主要贡献,除了量化问题的严重程度(213个指标中仅31个达标)之外,还在于提出了一个可复制的评估框架,使指标适用性可以被可度量化地评估。这一方法支持更具责任感的自适应系统AI设计:其中结果的解读要求对可靠性进行显式验证,并持续监控其随时间的违背情况。

我们能信任AI推断的用户状态吗?验证运营环境中LLM用户状态分类可靠性的心理测量学框架:论文配图
图1:研究流程示意:以心理测量学框架审计AI推断的用户状态是否可信。