论文
注意力受限的奖励学习
Attention Limited Reward Learning
摘要
成对人类比较是现代AI系统学习人类偏好的主要接口。RLHF及相关对齐管线通常以Bradley-Terry对数几率建模此类比较——选择概率由潜在奖励差决定。本文经理性忽视启发的简化模型考察该假设遗漏了什么:每个标签由低容量评估通道生成。模型区分标准奖励建模常混淆的两种含糊:比较困难可能因为两个候选在价值上确实接近,也可能因为相关区别在有限注意力下难以察觉。我们显示有限注意力会根本性扭曲成对比较揭示的内容:被动比较数据一般无法区分奖励、注意力与默认倾向,异质注意力会使标准Bradley-Terry建模恢复误导性排名。学习由每标签承载的已注意信息量主导,而非标签的原始数量。Chatbot Arena人类投票案例呈现预测签名——超过采样噪声、且无标量奖励可表示的比较数据循环分量;感知比较案例显示响应时间与注视承载标签所不含的差距信息。人类反馈应被视为注意力受限的测量过程:弱偏好信号可能反映隐藏的评估难度而非真实 indifferent。