论文

CORE:可验证语言模型搜索的冲突导向推理消除

CORE: Conflict-Oriented Reasoning Elimination for Verifiable Language-Model Search

模型推理推理搜索与路径规划

摘要

测试时推理系统通常会通过重新启动或修改最新步骤来响应失败,即使早期的决策导致了错误。我们引入了 CORE,一个搜索控制器,它向验证者请求经过认证的冲突核心,回跳到该核心中的最新决策,并缓存冲突以避免重复。在健全的验证、有限的分支和深度以及详尽的建议下,无上限搜索是完整的,并且永远不会修剪有效的解决方案。在 2,000 个具有匹配提案和精确验证器的植入图形着色实例上,相对于按时间顺序修复,CORE 将 30 个变量的验证器调用中位数减少了 39.8%,将 36 个变量的验证器调用中位数减少了 35.0%;缓存进一步改进了单独的回跳。在五项推理任务中,CORE 使用 Qwen2.5-7B-Instruct 实现了 75.9% 的平均成功率,使用 Qwen3-8B 实现了 84.2% 的平均成功率,而 Tree of Thoughts 的平均成功率为 72.5% 和 81.8%。它还在两个主干上使用更少的验证程序调用和生成的词元。这些结果显示了使用经过认证的故障解释来指导语言模型搜索的价值。