论文
LSR-Synth中的库可达性:防记忆设计如何改变符号发现的测量
Library Reachability in LSR-Synth: How Anti-Memorization Design Changes the Measurement of Symbolic Discovery
摘要
现有的基准测试对于科学方程发现大多基于公开领域中的已知方程,这使得模型是否从数据中发现规律还是仅仅从其训练数据中回忆答案难以确定。LSR-Synth通过引入新颖的合成术语到已有的科学机制中,并过滤出新颖性、可解决性以及科学合理性,从而解决了这一问题。本文探讨了一个更狭窄的测量问题:这些任务是否进一步区分由语言模型提供的科学先验与传统操作搜索,后者不涉及任务语义。我们使用一个固定词汇构建了一个无语义基准,并通过语义屏蔽、库削弱以及匹配的操作家族淘汰来评估候选覆盖度。在当前的任务抽样、搜索预算和评分协议下,固定词汇已经覆盖了大多数任务,而语言模型生成的候选者很少扩展到可解决的实例集合。它们的边际贡献只有当候选覆盖度被选择性破坏时才变得显著。严格的跨分布评估降低了所有方法的绝对成功率,但并未改变这一关系。这些发现既不否定LSR-Synth对完整公式记忆的控制,也不意味着语言模型先验通常无益。相反,它们支持一个更有限的结论:当前的任务大多适合评估未见过表达的匹配和组合,但不足以识别超出固定搜索空间的先验贡献。
