论文

LLM自我改进中的赢家诅咒:选择噪声与接受规则

The Winner's Curse in LLM Self-Improvement Loops: Selection Noise, Lock-in, and Acceptance Rules

模型评测智能体系统智能体自我改进鲁棒性、公平性与可信度评测

摘要

自我改进的LLM系统会向自己提出改变,并保留那些在小型评估集上得分较高的系统。我们将这种“保持更好”的步骤视为测量噪声下的选择,在单个决策中对候选者的相关误差进行建模,并凭经验研究重用评估集时会发生什么。在 Qwen 模型重写自己的指令并且每个候选者也在 600 个保留项目上进行评分的运行中,第一个之后的大多数提案都是有害的,并且该模型给出了一代最佳候选者的获胜者诅咒的大小。使用来自单独试点的先验,它与本机循环中第一代提交的平均夸大相匹配,尽管不是通过设置进行设置。在一项预先注册的研究中,贪婪循环的最终选择集得分在 16 个选择项中超出了保留准确度 13 到 20 分,在 256 个选择项中超出了 1 到 5 分。保留增益随着 TREC 上的选择集而增长,但在 GSM8K 上却没有,并且测试的接受规则在整个运行中没有击败贪婪接受。当当前模型改进了有效的指令时,在选择集上测得的增益也超过了保留的增益,并且在 GEPA 和 MIPROv2 的验证分数中也超过了保留的增益。对从未用于选择的 64 个项目的起始指令和当前指令进行评分消除了循环报告增益的平均偏差,但单个估计值仍存在约 6 分的偏差。自我完善研究应该报告所取得的成果及其不确定性。