论文
Project Auto-World:迈向神经关系推理器的自动化基准测试
Project Auto-World: Towards Automated Benchmarking of Neural Relational Reasoners
摘要
对关系结构的推理对神经模型仍是重大挑战——尤其当它们必须系统地把学得的知识应用到比训练所见更难的问题实例时。进展受评估此类泛化的困难阻碍——因为先验地看——什么使一个实例困难很少是清楚的。我们研究如何经用大语言模型(LLM)自动化基准生成来解决该问题——学习以端到端方式产生日益困难的实例。具体地——给定由Datalog规则参数化的世界——以及作为推理评估器的Edge Transformer——我们使用LLM驱动的演化搜索(基于FunSearch)与自主智能体搜索来发现产出困难问题实例的采样函数。我们还表明Edge Transformer可用该数据改进——使其能良好泛化到进一步的数据扰动。最后——我们表明同一机制可应用于LLM提出的新世界——为神经关系推理的自主研究打开大门。
