论文

主动概念学习中的大胆猜测与温和猜测

Wild Guesses and Mild Guesses in Active Concept Learning

模型评测模型行为与机制分析

摘要

人类的概念学习通常是主动的:学习者选择查询或测试哪些实例,以减少对潜在规则或类别的不确定性。主动概念学习必须在查询的信息量与生成并评分假设的学习者的稳定性之间取得平衡。我们在一个神经符号贝叶斯学习者中研究这一权衡,其假设是由大语言模型(LLM)提出、并经贝叶斯更新重新加权的可执行程序。我们比较了两种策略:选择查询以最大化近似期望信息增益(EIG)的理性主动学习者,以及人类式的正向测试策略(PTS),后者查询在当前最佳假设下被预测为正的实例。在经典数字游戏(Number Game)的概念学习任务中,当需要证伪时(例如复合规则或充满例外的规则),EIG 是有效的,但在简单概念上表现不佳。我们将这一失败追溯到 EIG 策略与 LLM 提议分布之间的支撑失配:高度诊断性的边界查询将后验推向生成器会产生无效或过于特殊程序的区域,从而在粒子近似中形成支撑失配陷阱。PTS 在信息上并非最优,但倾向于通过选择“安全”的查询来维持提议的有效性,从而在简单规则上更快收敛。我们的结果表明,“确认偏误”可能并非认知错误,而是一种理性适应,用以在人类思维特有的稀疏、开放式假设空间中维持可处理的推理。

主动概念学习中的大胆猜测与温和猜测
图1:代表性 Medium-rule 试验中真实概念的负对数似然(NLL)随时间的变化(越低越好)。