论文
面向LLM符号回归的程序化上下文增强
Programmatic Context Augmentation for LLM-based Symbolic Regression
摘要
符号回归(SR)——发现最能描述给定数据集的数学表达式——仍是科学发现中的基础挑战。以遗传算法及相关演化方法为主的传统路线已被证明有用,但存在可扩展性与表达力局限。近期基于LLM的演化搜索方法被引入SR并展现出前景。然而现有LLM方法在搜索过程中通常只依赖标量评估指标(如均方误差)作为唯一反馈来源,忽视了数据集中蕴含的丰富信息。为突破该局限,我们提出一个引入程序化上下文增强的新型LLM演化搜索框架:通过支持与数据集的代码交互,我们的方法能主动执行数据分析并提取有信息量的信号,超越聚合评估分数。我们在LLM-SRBench等先进基准上评估该框架,展示相较强基线的效率与精度优势。