论文
评估LLM的发展认知能力
Evaluating Developmental Cognition Capabilities of LLMs
摘要
对话式人工智能围绕用户的偏好、历史、目标和知识越来越个性化,但更不围绕用户如何解释和采用模型输出来构建和理解他们的现实。我们借鉴罗伯特·基根的建设性发展理论作为这个维度的补充视角。凯根传统中评估发育阶段的现有方法要么依赖于不具有规模的专家访谈,要么依赖于专有的、冗长的或侵入性的句子完成工具。为了使这一观点易于LLM评估,我们引入了发展句子完成测试(DSCT),这是一种包含 20 项的工具,旨在在自管理文本中引出发展信号。在整个过程中,我们将由此产生的标签视为引发响应中阶段性结构的表征,而不是作为经过验证的人级发展阶段。然后,我们询问LLM可以在三种引发的响应机制中恢复多少信号:模拟角色、真实人类受访者和默认模型生成的答案。在模拟角色上,顶级前沿模型可以高精度地恢复模拟器预期的标签。在真实的人类 DSCT 反应中,人类与LLM的一致性是公平的,邻域内一致性比精确一致性强得多。最后,当LLM在没有角色调节的情况下回答 DSCT 提示时,他们的反应在模型系列中表现出稳定的阶段式差异,更大和更新的模型往往会生成评分更高的文本。这些结果表明,合成响应中的阶段条件信号比人类编写的 DSCT 文本中的更清晰,并且阶段感知对话 AI 的核心约束不仅仅是分类器的准确性,而是来自引出文本的发展信号的可用性。
