论文

通过激励和纠正来调整人工智能

AI Alignment via Incentives and Correction

模型训练奖励建模与过程监督

摘要

我们通过威慑和执法的法律和经济模型的视角来研究人工智能的一致性。在这些模型中,不当行为不被视为外部失败,而是作为对激励的战略反应:行为者权衡违规带来的收益与被发现的可能性和惩罚的严重程度。我们认为,同样的逻辑自然会出现在代理人工智能管道中。求解者可能会受益于产生有说服力但不正确的答案、隐藏不确定性或利用虚假的捷径,而审计员或验证员必须决定昂贵的监控是否值得。因此,一致性是一个定点问题:更严厉的惩罚可能会阻止求解器的不当行为,但它们也会降低审计员进行检查的动机,因为审计主要会在看起来越来越一致的群体上产生成本。这种观点也改变了应该算作 后训练 信号的内容。标准反馈通常仅对最终答案给予奖励,但求解器-审计器管道公开了完整的纠正事件:求解器是否出错、审计器是否进行了检查、错误是否被捕获以及监督激励是否仍然有效。我们在双代理模型中将这种交互形式化,其中委托人选择奖励而不是联合纠正结果,从而诱导求解器行为和审计员监控。因此,奖励设计是一个双层优化问题:奖励不是根据其直接语义来判断的,而是根据它们引起的行为平衡来判断的。我们提出了一种基于老虎机的外循环程序,用于使用噪声交互反馈来搜索奖励配置文件。 LLM 编码管道上的实验表明,自适应奖励配置文件可以保持有用的监督压力,并相对于静态手工设计的奖励改善委托人一致的结果,包括大幅减少幻觉的错误尝试。