论文

自纠编码 Agent 的自适应 Dirichlet 证据蒸馏

How Much Evidence Should a Coding Agent's Self-Correction Carry? Adaptive Dirichlet Evidence for Self-Distillation

摘要

执行反馈让编码人员智能体修改程序并从自己的更正中学习。修正的学习权重应该反映其执行所支持的转变以及该支持背后的证据数量。我们引入有效证据自蒸馏(EESD),它分别代表这些量。归一化的执行相关性决定了相对转换支持和有效的伪计数质量;然后,狄利克雷后验生成用于 KL 锚定校正学习的不确定性惩罚权重。在对称先验下,改变质量可以保留类别排序,有效质量会产生一个受其匹配的固定质量对应项限制的监督系数。在四个模型域历史扫描中,将可见观测值从 1 个增加到 8 个,可以将未来结果 NLL 降低 55.0-59.3%。在八次观察中,在所有四次比较中,有效质量的 NLL 都低于固定质量。在主要匹配的 DeepSeek/RunBugRun 研究中,argmax 预测对所有 3,000 个示例都一致,在集中相关性下 NLL 增益最大。经过一轮修正学习后,DeepSeek/CodeARC 所有测试 Pass@1 从 15.0% 增加到 20.4%,配对的 95% 源引导区间为 [+2.8, +8.0] 个百分点。十二设置下游评估确定了此更新的模型域范围。这些结果表明,将证据支持与证据质量分开如何改变智能体编码中的概率估计和校正学习。

自纠编码 Agent 的自适应 Dirichlet 证据蒸馏:论文原图
图 1:编码智能体自我校正的方向和强度。 (a) 修复偏离一范围错误将四次公共执行从失败更改为通过。 (b) 通过转换聚合执行相关性给出 $r=(1,0,0,0)$:所有支持都支持 Fix。 (c) 统一相关性和集中相关性下的相同转换给出 $E(p)=4.000$ 和 $1.062$;在固定的先验和效用设置下,它们会产生不同的监督权重。 $p$ 条形图索引执行,而 $r$ 条形图索引转换类别。相关向量定义了固定转换支持下的分析示例。