论文

行为可信度三难困境:当校准自主变得不可能时

The Behavioral Credibility Trilemma: When Calibrated Autonomy Becomes Impossible

智能体系统Agent 动作执行与治理

摘要

我们证明,每当某些任务超出代理的可靠能力时,具有置信门控自主性的强化学习策略都无法同时实现最大帮助、最佳校准和在理性监督下的完全自主:行为可信度三难困境。这种不可能性是几何级数的:在严格适当的评分规则中添加任何非仿射自主激励都会破坏严格的适当性,因此,每当自主权权益超过清除它的校准成本时,因校准信心和自主行动而获得奖励的代理就会系统性地夸大其报告的对低于委托人批准阈值的任务的信心。行为扰动引理对通货膨胀进行了量化(Brier 分数的缩放比例为 $w_A/(2 w_C)$),并显示检测需要内部报告的 $Ω(1/Δ^2)$ 观察值。我们证明,在不饱和状态下,没有仿射监督规则对于委托人来说是最优的,并且最优是通过满足三难困境本身假设的尖锐阈值来实现的,因此不可能性是内生的而不是假设的;此外,对于 Brier 分数下的对称、对数凹、完全支持位置策略族,校准甚至不是策略梯度训练的驻点。我们将置信门控决策问题形式化,将现有方法映射到三难困境上,并确定两种建设性的解决途径(承诺、角色分离)。 540 配置的 Best-of-N 实验测试了五个假设,所有假设都得到了充分证实(效果大小 $d = 1.10$ 至 $5.35$,每次完成估计器的上限,在每个任务聚合上夸大幅度),并根据预先指定的协议在另外两个模型系列上进行复制,并添加了对可实现的 $(H, C, A)$ 表面几何形状的描述性分析,显示了平台截断边界与预测的通胀饱和度一致。