论文

Project Auto-World:迈向神经关系推理器的自动化基准测试

Project Auto-World: Towards Automated Benchmarking of Neural Relational Reasoners

模型评测基准与评测资源

摘要

对关系结构的推理对神经模型仍是重大挑战——尤其当它们必须系统地把学得的知识应用到比训练所见更难的问题实例时。进展受评估此类泛化的困难阻碍——因为先验地看——什么使一个实例困难很少是清楚的。我们研究如何经用大语言模型(LLM)自动化基准生成来解决该问题——学习以端到端方式产生日益困难的实例。具体地——给定由Datalog规则参数化的世界——以及作为推理评估器的Edge Transformer——我们使用LLM驱动的演化搜索(基于FunSearch)与自主智能体搜索来发现产出困难问题实例的采样函数。我们还表明Edge Transformer可用该数据改进——使其能良好泛化到进一步的数据扰动。最后——我们表明同一机制可应用于LLM提出的新世界——为神经关系推理的自主研究打开大门。

Project Auto-World:迈向神经关系推理器的自动化基准测试:论文配图
(a) (b) (c) 图 4:(a) AST 词元热图:2020 年优先级函数中前 4040 个词元的 log⁡(1+count)\log(1{+}\textrm{count})。 (b) 以列为中心的标记计数矩阵的 SVD 谱:每个分量的方差份额(条形)和累积份额(线)。水平线标记 90%90\% 解释的方差。 (c) PC1-PC5 空间中跨轮的每次进化搜索运行 (Evo1-Evo4) 的轨迹。