论文

ReMCTS:用于代码生成的反射增强蒙特卡罗树搜索

ReMCTS: Reflection-Enhanced Monte Carlo Tree Search for Code Generation

模型推理推理搜索与路径规划

摘要

开放权重大语言模型 (LLM) 可以根据自然语言提示生成功能级程序,但看似合理的候选模型仍然会在隐藏语义上失败,并在修复尝试中重复错误。我们引入了 ReMCTS,这是一个基于执行、内存增强、LLM 指导的 MCTS 风格的搜索框架。它将候选程序组织为树状态,保留分支本地调试上下文,检索跨分支的失败经验,并将失败的检查与不可用的证据区分开来。在 HumanEval 和 MBPP-Sanitized 上,可见测试 ReMCTS 在保留评估下的 10 个模型数据集对中的 8 个中比直接生成有所改进,而仅代理搜索则不太稳定。受控的树搜索、采样、修复和内存消融描述了这些增益的来源和限制。 30 任务 HumanEval-X C++ 试点进一步证明了与编译器支持的执行的兼容性,但并不构成广泛的多语言评估。