论文

LLM 当他们知道但不采取行动时就知道:用于测试时间缩放的元认知工具

LLMs Know When They Know, but Do Not Act on It: A Metacognitive Harness for Test-time Scaling

模型推理测试时计算扩展

摘要

大语言模型(LLM)经常暴露自我监控的有用信号:在解决问题之前,他们可以估计自己是否有可能成功,在解决问题之后,他们可以判断自己的答案是否可能是正确的。然而,这些信号通常是单独测量或引发的,而不是用于控制推理。在这项工作中,我们询问 LLM 是否具有可以转化为有效的测试时间控制的潜在元认知能力。受认知心理学中的纳尔逊-纳伦斯理论的启发,我们提出了一种将监控与推理分开的元认知工具。对于每个问题,模型首先报告一个解决前的知觉 (FOK) 信号;每次尝试求解后,它都会报告求解后学习判断 (JOL) 信号。该工具并没有将这些信号视为被动的置信度估计,而是将它们转变为用于推理的显式控制接口:它决定何时信任当前解决方案,何时使用紧凑的元认知反馈重试,以及何时将多次尝试传递给最终聚合器。在文本、代码和多模态推理基准测试中,我们的工具极大地改进了固定的 Claude Sonnet-4.6 基本模型,无需参数更新或特定于基准测试的 微调。在评估的公共基准快照上,它将汇总准确度从 48.3 提高到 56.9,并超过了三个主要评估设置(HLE-Verified、LiveCodeBench v6 和 R-Bench-V)中列出的最强排行榜条目。这些结果表明,强大的 LLM 可能已经具备有用的元认知能力,但需要明确的控制工具在推理过程中对其采取行动。