论文

谁来给评分器打分:为自进化LLM智能体共同演化评估指标与技能

Who Grades the Grader? Co-Evolving Evaluation Metrics and Skills for Self-Improving LLM Agents

模型评测智能体系统Agent Skills智能体自我改进评测方法与指标

摘要

自进化智能体系统创建、修订并淘汰自己的技能,但每个这样的回路都假定可靠的评估指标已经存在。在许多真实应用中并不存在。我们显示指标本身可以成为演化对象:我们的回路在完整进化生命周期下搜索小型类型化缺点检测器的组合,以与十项锚定参照集的一致性选择、并以未标注输出上的共识正则化。演化的是给单个输出打分的函数,从不演化它被打分的固定任务集;产出是可检查的表达式而非不透明裁判。它也有效:在代码生成上,指标选择从未读过的锁定集上,与隐藏真值的一致性提升0.21(配对p=0.014),胜过它所包含的裸LLM裁判。效度是安全的所在:移除锚守卫会把指标塌缩为空洞的永远通过检测器,而移除检测器生命周期则不会——颠倒了技能演化的教训。该塌缩警告这一方向的工作:下游任务分不能验证自进化评估器,因为塌缩的指标同样能训练技能。任务分只回答充分性,而演化出的指标够用:与生命周期管理的技能回路共同演化的Double Ratchet,在MBPP+、Spider 2.0-Snow与报告生成上保留真值或手写量规所买增益的88–110%。当演化出的技能钻报告量规空子时,独立裁判抓到了它,新增一个检测器完成修复。