论文
人工智能能猜出你知道什么吗? 大语言模型 从通信日志估计人类领域知识的性能比较
Can AI Guess What You Know? Performance Comparison of Large Language Models for Human Domain Knowledge Estimation From Communication Logs
摘要
员工常常难以识别“谁知道什么”,从而导致组织生产力下降。我们研究 大语言模型 (LLM) 是否可以直接从长期 Slack 日志中推断出单独的领域知识。通过分析来自 43 位用户的 27,188 条消息,我们通过将零样本估计与 27 位参与者自我报告的技能评级进行比较,评估了 7 个模型(包括 Gemini、Claude 和 GPT 系列)。 Gemini 2.5 Flash 实现了最低的误差(MAE 21.13%),而 GPT 模型则显示出明显更大的差异。值得注意的是,估计准确性对消息量的依赖程度很弱,这表明仅靠更多的文本并不能保证更好的推理。这些发现证明了自动化专业知识映射的可行性和当前局限性,强调了对隐私保护部署和更丰富、结构感知的人类知识表示的需求。