论文

面向ARC-AGI-2的模态驱动搜索与整体轨迹评判

Modality-Driven Search with Holistic Trace Judging for ARC-AGI-2

模型推理推理验证与自校正

摘要

大型语言模型可以为抽象推理任务生成流畅、内部连贯的推理轨迹,同时仍然肯定是错误的——使候选者中的选择,而不仅仅是生成,成为核心挑战。我提出了 ARC-AGI-2 的求解器,这是一个少镜头视觉推理基准,围绕两个原则构建:(i) 将推理模式视为搜索运算符,跨文本、图像和代码通道独立生成不同的候选者,以及 (ii) 上下文保留整体判断,其中判断模型联合比较单个长上下文提示中的所有候选者推理轨迹。与自洽或多数投票不同,这种方法可以在模态答案错误的任务上可靠地恢复正确的少数假设。在 ARC 奖半私人评估集上,该求解器以每项任务 38.99 美元的价格获得了 72.9% 的成绩,这是撰写本文时已验证排行榜上的最高分,超过了最好的独立前沿模型 GPT-5.2 Pro 的 54.2% 和 Gemini 3 Pro 的 54.0%,高出了 18.7 个百分点。在公共评估集上,它以每项任务 19.69 美元的价格实现了 76.1%。我发布了完整的源代码并记录了广泛的负面结果,包括发现规定性提示模板和迭代细化系统地减少了假设多样性并降低了性能。

面向ARC-AGI-2的模态驱动搜索与整体轨迹评判:论文配图
图 1:ARC-AGI-2 任务 3dc255db。人类可能会看到排气侧带有颗粒的“宇宙飞船”。这种转变将颗粒从内部移除,并将它们从鼻子中延伸出来。三个训练对(第 1-3 行)演示了该规则;测试输入(第 4 行)必须仅从这些示例中求解。这个任务仍然悬而未决。