论文
反例游戏:语言模型中的迭代概念分析和修复
The Counterexample Game: Iterated Conceptual Analysis and Repair in Language Models
摘要
概念分析——提出定义并通过反例完善它们——是哲学方法论的核心。我们研究语言模型是否可以通过迭代分析和修复链来执行此任务:一个模型实例生成建议定义的反例,另一个模型实例修复定义,然后重复该过程。在 20 个概念和数千个反例修复周期中,我们发现,尽管许多 LM 生成的反例被人类专家和 LM 法官判定为无效,但 LM 法官接受的反例数量大约是人类的两倍。尽管如此,每个项目的有效性判断在人类之间以及人类与 LM 之间是适度一致的。我们进一步发现,扩展迭代会产生越来越冗长的定义,而不会提高准确性。我们还看到一些概念通常抵制稳定的定义。这些发现表明,虽然 LM 可以进行哲学推理,但反例修复循环很快就会出现收益递减,并且可能是评估 LM 是否能够维持高水平迭代哲学推理的富有成效的测试用例。