论文
基于缩放假设的无标签智能体学习框架能力评估
Evaluating Agentic Learning Harness Capabilities Without Labels via the Scaling Hypothesis
摘要
智能体式“持续学习框架”——将LLM与检索或记忆配对、无需重训即可从反馈中改进的系统——在网络安全领域显示出越来越大的价值。但其价值通常通过与有标签基准相比的增益来衡量,这种做法在实战安全环境中常常失效:基准标签稀缺、过时且不具代表性,实践者往往无法判断某个框架是否有效,或两个框架中哪个更适合自己的任务。传统LLM-as-a-judge提供的信号有限,因为它不比被评估的智能体更强;而蒸馏在稀缺、零散且有偏的标签上也不可靠。我们提出一个无需有标签基准即可端到端评估学习框架的方案,其基础是缩放假设:更强的教师模型向配备持续学习框架的较小学生模型稀疏地提供纠正,我们以学生随时间向教师收敛的程度为框架打分。跨越安全任务、模型家族和框架设计,我们证明相对教师的改进与相对留出金标准的改进相关,验证了在无标签时以“教师相对提升”作为真实框架提升的代理。我们进一步证明,能力相近的模型之间使用LLM-as-a-judge不会产生可用信号。这些结果表明,当人类提供同样稀疏、高精度的纠正时,教师规模的模型也能通过同一框架获得改进。
