论文

作为偏好学习的渐进自主:智能体工具使用信任校准的形式化

Progressive Autonomy as Preference Learning: A Formalization of Trust Calibration for Agentic Tool Use

智能体系统Agent 动作执行与治理

摘要

我们将智能体工具使用中的信任校准(决定自动化智能体提出的动作何时可自主执行、何时需要人类批准)形式化为一个偏好学习问题。策略网关在潜在的人类风险容忍函数上维护高斯过程后验,该函数通过二元批准/拒绝反馈上的probit似然来观测,并在批准结果最不确定之处恰好上报人类。我们证明这在结构上是偏好贝叶斯优化(Preferential Bayesian Optimization)的一个实例,继承其推断机制(近似高斯过程分类)与样本效率论证(以不确定性为目标的查询),但目标不同:将动作空间划分为允许/阻止/询问三个区域,而非优化一个设计。