论文
ReaComp:将 LLM 推理编译为符号求解器以实现高效的程序综合
ReaComp: Compiling LLM Reasoning into Symbolic Solvers for Efficient Program Synthesis
摘要
LLM 可以解决程序综合任务,但在需要大量组合搜索的硬实例上仍然低效且不可靠。给定一小组推理轨迹,我们使用 编码智能体 将它们编译成基于受限 DSL 的可重用符号程序合成器。由此产生的求解器在测试时不需要 LLM 调用,并且是强大的独立系统:符号求解器集成在 PBEBench-Lite 上达到 91.3% 的准确度,在 PBEBench-Hard 上达到 84.7% 的准确度,优于 LLM,后者的测试时间缩放在零 LLM 推理成本下增加了 16.3 个百分点。它们还补充了 LLM 搜索,将 PBEBench-Hard 准确率从 68.4% 提高到 85.8%,同时将报告的词元使用率减少 78%,并将神经符号混合设置中的 SLR-Bench 硬层准确率从 34.4% 提高到 58.0%。与直接使用 编码智能体 作为每个实例求解器相比,诱导求解器的帕累托效率要高得多,可以在许多零词元执行中分摊少量的一次性构建成本。最后,大多数求解器将零样本转移到真实的历史语言学任务 - 预测自然语言数据中的声音变化 - 在集成和恢复一些看似合理的语言规则下达到 80.1% 的准确度。总之,这些结果表明,推理轨迹可以编译成可重用的符号求解器,直接解决许多任务,补充困难情况下的 LLM 推理,并为领域通用求解器归纳提供可扩展的途径。我们发布代码和数据以实现可重复性。