具备自主规划与长程环境交互能力的智能体AI系统提出了一个根本性的控制问题:对于可能超越人类自身能力的系统,人类如何保持有意义的监督?现有的可扩展监督方法要么依赖复杂假设,要么基本停留在启发式层面,要么缺乏面向序贯设定且带有统计保证的实用方法。我们提出校准式集体监督(Calibrated Collective Oversight,CCO),它将多样的辅助评分函数聚合为一个度量偏离保守基线程度的惩罚项。受可达效用保持(Attainable Utility Preservation)启发,CCO实现了集体保守性:动作面临的惩罚与监督者的担忧成正比,因此当监督者认为无可异议时高效用动作仍会被选中,只有当担忧累积时才会被否决。CCO利用保形决策论(Conformal Decision Theory)在线校准这种保守性,确保不良后果保持在用户指定的目标阈值之下,并具有有限时间界且不作分布假设。在修改版SWE-bench上,较弱的监督者成功约束了对抗性不对齐的更强智能体;在MACHIAVELLI上,CCO在保持奖励的同时大幅减少了伦理违规。在两种设定中,实际违规率都如理论预测的那样与指定目标紧密吻合。
图 1:校准集体监督 (CCO) 概述。给定状态 ss,主代理要么生成候选动作 {a1,a2,a3,…}\{a_{1},a_{2},a_{3},\ldots\},要么从环境中接收固定集,为每个动作分配反映其自身偏好的效用分数 U(s,a)U(s,a);始终包含保守的基线 aoa_{o} (例如,延迟或无操作)。这些候选者可能包括具有隐藏漏洞或目标不一致的行动,由一组辅助监督者 {q1,…,qn}\{q_{1},\ldots,q_{n}\} 进行评估,每个监督者评估不同的维度,例如范围、安全性或约定遵守情况。总惩罚 Δ(s,a)=Σi|qi(s,a)−qi(s,ao)|\Delta(s,a)=\sum_{i}|q_{i}(s,a)-q_{i}(s,a_{o})|衡量所有监督信号中每项行动偏离基线的程度。 CCO 通过最大化 U(s,a)−λtΔ(s,a)U(s,a)-\lambda_{t}\Delta(s,a) 来选择动作,其中保守性参数 λt\lambda_{t} 通过共形控制器在线更新:在观察所选动作是否产生损失 ℓt\ell_{t} 后,控制器进行调整λt+1=λt+η(ℓt−α)\lambda_{t+1}=\lambda_{t}+\eta(\ell_{t}-\alpha)。该反馈循环确保实现的违规率收敛于用户指定的目标 α\alpha。在安全情况下,CCO 放松保守主义以允许高效用的行动;在危险情况下,它会增加保守主义倾向,支持更安全的替代方案。