论文
校准评估器:概率校准是否可以减轻 LLM 代理反馈循环中的偏好耦合?
Calibrating the Evaluator: Does Probability Calibration Mitigate Preference Coupling in LLM Agent Feedback Loops?
摘要
当 大语言模型 (LLM) 代理通过评估者反馈调整其行为时,系统评估者偏差会传播到代理的学习策略分布中 - 这种现象称为评估者偏好耦合。先前的工作已经记录了这种耦合并建立了一个诊断框架(EPC)来测量它,但尚未研究校准技术是否可以减轻这种影响。我们提出了第一个评估者校准作为缓解措施的研究:将概率校准应用于评估者的成对判断,以减少虚假偏好传播。在使用 DeepSeek-V4-Pro 作为执行器和 GLM5.2 作为评估器的受控受试者内实验 (N=5) 中,比较标准二元 TTRL(获胜/失败)与置信校准 TTRL(概率加权更新),我们发现校准将耦合系数 gamma 降低了 20-49%,Jensen-Shannon 散度降低了 45-67%。对称 LR 控制确认该效果不是由于更新不对称性减少所致。我们发布了经过校准的 TTRL 协议,并推荐将其作为 LLM-as-judge 部署管道的轻量级缓解措施。