论文

SU:用草稿模型预测编码智能体的不确定性并在执行前门控

How to Speculate about Uncertainty in Agentic Coding? A Draft-Model Gate Method

智能体系统Agent 动作执行与治理

摘要

为软件工程部署的 LLM 代理的失败代价高昂:它们自信地采取错误的行动,并且只有在代价高昂的执行和重试之后才能识别出不良行为。我们提出了推测不确定性(SU),这是一种仅从黑盒代理的输出词元中恢复预测故障信号的方法,无法访问 logits、权重、激活或重复采样。与 推测解码 相反,一个小型开放权重草案模型在一次前向传递中对智能体已生成的轨迹进行评分。从这些推测的交叉可能性中,我们通过分离推理和行动跨度来提取阶段感知特征,并根据可验证的目标对其进行校准。 SU 生成一个故障可能性分数,任何下游策略(例如路由、人工干预或额外的测试时间计算)都可以直接使用该分数。为了表明该信号是可行的,我们在软件工程代理 Qwen3-Coder-480B 和闭源 Claude 3.5 Sonnet 上实例化了这样一个策略,即预执行否决门,将部署中的执行错误率降低了 6-8 个百分点,将词元成本降低了 14-19%,无需重新训练即可转移到发行版基准,并在代理模型之间进行泛化。