论文
经约束的可控性:编码智能体可扩展监督的基底
Steerability via constraints: a substrate for scalable oversight of coding agents
摘要
编码智能体有能力;人类监督是瓶颈。无约束的智能体引入安全风险、侵蚀代码库可扩展性——并使人类审查日益昂贵。我们主张:数十年来用于管理大型人类工程团队的方法——访问控制、网络策略、由工具强制执行的严格编码规范——可直接迁移到编码智能体——且(按token计)比近期智能体脚手架更便宜。我们勾画基于该原则的端到端系统——并报告一项可扩展监督的受控实验:小型审查者(Gemma 4 e4b)检查含11个植入后门的Python代码库。召回率从54.5%(无约束、无工具)升至90.9%(受约束基底加约200行代码的docs CLI)——基底与工具各自独立贡献。我们刻意选择Python:基底级监督收益在语言默认保证最少处最大;该原则可扩展到Rust等语言。