论文

通过可扩展的交互式监督引导LLM

Steering LLMs via Scalable Interactive Oversight

智能体系统Agent 动作执行与治理

摘要

随着大语言模型日益自动化复杂的长程任务(如“vibe coding”),一个监督缺口随之出现。模型虽擅长执行,但用户常因领域专业知识不足、难以清晰表达精确意图,以及无法可靠验证复杂输出,而难以有效引导模型。这在可扩展监督(scalable oversight)中构成关键挑战:让人类在超出其自身指定或验证能力的任务上负责任地引导AI系统。为解决这一问题,我们提出可扩展交互式监督(Scalable Interactive Oversight),一个把复杂意图分解为可管理的决策递归树以放大人类监督的框架。我们的系统不依赖开放式提示,而是在每个节点引出低负担反馈,并递归地把这些信号聚合为精确的全局引导。在网页开发任务上的验证表明,该框架使非专家产出专家级产品需求文档(PRD),对齐度提升54%。更关键的是,我们证明该框架可以仅用在线用户反馈经由强化学习进行优化,为AI规模扩大时维持人类控制提供务实路径。

通过可扩展的交互式监督引导LLM
图1:动机:随着AI在解决复杂问题方面日益超越人类,人们常常仅凭自然语言指令将软件开发等任务委托给AI。然而,这种协作中会产生不一致(misalignment)。这是因为人类成为了弱势的监督者;他们难以对庞大的输出和具有挑战性的任务提供反馈。为解决这一问题,我们提出一个框架:我们将任务分解为结构化树 𝒯 t \mathcal{T}^{t} 。在节点 v t v^{t} 处的交互之后,用户偏好被累积起来,用于将 𝒯 t \mathcal{T}^{t} 更新为 𝒯 t + 1 \mathcal{T}^{t+1} 。这样一来,之后的交互将更加符合用户。系统不断循环,直到所有节点完成为止。