论文
通过可扩展的交互式监督引导LLM
Steering LLMs via Scalable Interactive Oversight
摘要
随着大语言模型日益自动化复杂的长程任务(如“vibe coding”),一个监督缺口随之出现。模型虽擅长执行,但用户常因领域专业知识不足、难以清晰表达精确意图,以及无法可靠验证复杂输出,而难以有效引导模型。这在可扩展监督(scalable oversight)中构成关键挑战:让人类在超出其自身指定或验证能力的任务上负责任地引导AI系统。为解决这一问题,我们提出可扩展交互式监督(Scalable Interactive Oversight),一个把复杂意图分解为可管理的决策递归树以放大人类监督的框架。我们的系统不依赖开放式提示,而是在每个节点引出低负担反馈,并递归地把这些信号聚合为精确的全局引导。在网页开发任务上的验证表明,该框架使非专家产出专家级产品需求文档(PRD),对齐度提升54%。更关键的是,我们证明该框架可以仅用在线用户反馈经由强化学习进行优化,为AI规模扩大时维持人类控制提供务实路径。
