论文

超越静态快照:面向智能体前沿的语言模型依据对齐评估框架

Beyond Static Snapshots: A Grounded Evaluation Framework for Language Models at the Agentic Frontier

模型评测模型训练智能体系统强化学习Agent任务评测评测方法与指标RLVR长程任务评测

摘要

我们认为,当前大语言模型(LLM)的评估框架存在四个系统性故障,这使得它们在结构上不足以评估已部署的代理系统:分布无效性(评估输入不反映真实的交互分布)、时间无效性(评估是事后的而不是训练集成的)、范围无效性(评估测量单轮输出而不是长期轨迹)和过程无效性(评估评估输出而不是推理)。这些失败在 RLHF 中严重加剧,其中奖励模型是在 RL 训练期间不成立的条件下进行评估的,这使得奖励黑客成为评估设计的可预测结果,而不是训练病理学。我们提出了扎根连续评估(GCE)框架,并提出了 ISOPro,一个基于模拟的微调和评估系统。 ISOPro 用确定性的真实验证器取代了学习奖励模型,通过在可验证奖励域中构建来消除奖励黑客攻击,并在 CPU 上可更新的 LoRA 适配器权重上运行,从而将硬件障碍降低了一个数量级。我们在具有六个难度等级的资源受限调度领域上验证了 ISOPro,展示了只有通过持续评估才能看到的能力出现、无需研究人员管理即可形成的隐式课程以及比零样本基线提高 3 倍的准确度,所有这些都在可训练参数为 0.216% 的消费类硬件上进行。

超越静态快照:面向智能体前沿的语言模型接地评估框架
图 1:所有评估条件下的每层准确度。 ISOPro + LoRA(红色)在 T0 (100%)、T1 (66.7%) 和 T3 (66.7%) 上实现了最高准确度。在所有方法中,T2、T4 和 T5 保持为 0%,表明通过 GCE 框架的每层连续评估可见能力边界。