论文

PoTRE:受认知异质性启发的测试时推理

PoTRE: Test-Time Reasoning inspired by Cognitive Heterogeneity

模型推理推理搜索与路径规划

摘要

尽管大语言模型(LLM)在许多任务上表现出色,但它们在需要长程规划与迭代纠错的复杂推理上常常吃力。而且当模型遭遇新抽象或严格的领域约束时,标准的单流提示方式显得脆弱。我们提出PoTRE(多拓扑推理集成),一个异构框架:把推理解耦为四个智能体——(1)对抗精炼智能体、(2)层级战略规划智能体、(3)谱搜索智能体与(4)直接链智能体;最后的任务自适应聚合层动态调和这些视角——经最终候选选择、语义综合或神经符号验证——产出稳健的全局解。我们在三个前沿基准上评估PoTRE:ARC-AGI-2、Humanity's Last Exam(HLE)与PRBench Finance。PoTRE在HLE上取得49.92%的最先进准确率,超过此前最佳官方分数。我们证明该架构异质性以相近或更少的推理token取得优于重度扩展的同质基线的推理表现。

PoTRE:受认知异质性启发的测试时推理:论文配图
图 1:在三个不同的基准测试中,将配备 PoTRE 的较小 Gemini-3-Flash-Preview 模型(蓝色)与明显较大的 Gemini-3-Pro-Preview 基线(灰色)进行比较。在所有情况下,PoTRE 的架构脚手架使高效模型的性能优于使用先前工作提示运行的前沿模型,这表明推理时间推理结构可以有效替代参数尺度。