论文

能力自我评估:教会大语言模型认识自身局限

Capability Self-Assessment: Teaching LLMs to Know Their Limits

模型训练强化学习

摘要

识别自身局限并决定是自行求解还是委派的能力,是可靠智能系统的基础。然而我们表明,现代大语言模型系统性地缺乏这种能力:在不同模型家族与规模上,它们都高估自身能力并尝试解决自己无法完成的查询。我们将这种能力称为能力自我评估(CSA),并将其形式化为策略学习问题,旨在提升自我评估的同时保留模型原有能力。我们的结果显示,强化学习能有效教会CSA,在保留原有能力的同时显著优于监督微调。相反,监督微调会严重损害模型本应评估的那些能力。此外,学到的自我评估行为在分布外泛化良好,表明CSA是一种可迁移的模型特质。最后,CSA具有实用价值:它能改善推理时的本地-云端决策,并在训练期间为目标性数据选择提供信号。

能力自我评估:教会大语言模型认识自身局限:论文配图
图 1:当前模型缺乏跨模型系列和规模的 CSA,并在组合数学测试集上进行评估。 ▼\blacktriangledown 标记每个模型的自解决率,▲\blacktriangle 标记其实际精度。阴影条跨越两者之间的间隙,间隙越大表明 CSA 越弱。