论文

TRIAGE:评估LLM在资源约束下的前瞻性元认知控制

TRIAGE: Evaluating Prospective Metacognitive Control in LLMs under Resource Constraints

模型评测模型能力评测

摘要

将语言模型部署为自主智能体,所需的远不止单任务准确率:当智能体在有限token预算下面临一队问题时,必须在获得任何执行反馈之前,决定尝试哪些问题、以何种顺序尝试,以及为每个问题投入多少计算。这正是人类认知领域研究了数十年的前瞻性元认知控制,而语言模型是否具备这种能力仍未经检验。我们提出TRIAGE,一个评测框架:模型接收一个任务池和按其自身基线成本校准的token预算,并提交一份单一的有序计划,同时编码任务选择、排序和逐题资源分配。计划的评分参照一个完全掌握模型在各问题上可解性与成本的oracle进行,从而在统一尺度上得出分诊效率比。我们评测了开启与未开启推理的前沿及开源模型,覆盖竞赛数学、研究生水平科学、代码生成和专家级多学科知识,发现当前语言模型在前瞻性元认知控制上存在显著差距,揭示了一个此前未被测量的能力维度,对资源高效的智能体部署具有直接意义。

TRIAGE:评估LLM在资源约束下的前瞻性元认知控制:论文配图
图 4:每个基准的每(模型、模式)准确度。准确度是可解决问题的比例,与预算 α\alpha 无关。细胞使用连续的白色→\rightarrow青色刻度;水平线分隔模型系列; [std] / [ext] 后缀表示标准推理与扩展推理。