论文
自纠编码 Agent 的自适应 Dirichlet 证据蒸馏
How Much Evidence Should a Coding Agent's Self-Correction Carry? Adaptive Dirichlet Evidence for Self-Distillation
摘要
执行反馈让编码人员智能体修改程序并从自己的更正中学习。修正的学习权重应该反映其执行所支持的转变以及该支持背后的证据数量。我们引入有效证据自蒸馏(EESD),它分别代表这些量。归一化的执行相关性决定了相对转换支持和有效的伪计数质量;然后,狄利克雷后验生成用于 KL 锚定校正学习的不确定性惩罚权重。在对称先验下,改变质量可以保留类别排序,有效质量会产生一个受其匹配的固定质量对应项限制的监督系数。在四个模型域历史扫描中,将可见观测值从 1 个增加到 8 个,可以将未来结果 NLL 降低 55.0-59.3%。在八次观察中,在所有四次比较中,有效质量的 NLL 都低于固定质量。在主要匹配的 DeepSeek/RunBugRun 研究中,argmax 预测对所有 3,000 个示例都一致,在集中相关性下 NLL 增益最大。经过一轮修正学习后,DeepSeek/CodeARC 所有测试 Pass@1 从 15.0% 增加到 20.4%,配对的 95% 源引导区间为 [+2.8, +8.0] 个百分点。十二设置下游评估确定了此更新的模型域范围。这些结果表明,将证据支持与证据质量分开如何改变智能体编码中的概率估计和校正学习。
