论文

使用自然语言处理比较人类语义导航和 大语言模型

Comparing Semantic Navigation in Humans and Large Language Models using Natural Language Processing

模型评测模型能力评测

摘要

语义记忆检索可以被概念化为概念空间的导航。我们使用言语流利度数据比较了人类和三个 大语言模型(GPT-4o、Gemini-2.5-Pro、Claude-Sonnet-4.5)之间的语义搜索动态。通过将基于轨迹的 NLP 指标应用于 82 名人类参与者生成的项目和八种温度设置下的 LLM 输出,我们量化了三个互补维度:熵(步长可预测性)、到下一个的距离(连续的语义步骤)和到质心的距离(全局离散度)。与所有 LLM 相比,人类表现出更高的熵、更大的语义步骤和更广泛的分散性,表明更多的可变性和探索性搜索。温度调整仅产生部分对齐,因为在特定设置下人类和 LLM 之间的各个指标相匹配,但没有配置重现完整的人类概况(在所有维度)。这些发现表明,人类语义搜索在局部开发和全局探索之间实现了独特的平衡,而当前的模型架构无法重现这一点。