论文

SteerBench-Work:面向Agent行动边界转向决策的基准

SteerBench-Work: A Benchmark for Agent Steering at Action Boundaries

模型评测智能体系统Agent任务评测基准与评测资源长程任务评测

摘要

长时间运行的大语言模型智能体通过工具执行操作,单步操作就可能发送邮件、合并拉取请求或完成一笔支付。转向决策是在这一边界上提交前的选择:继续执行,还是暂停以等待人工或策略审查。我们提出 SteerBench-Work,一个以真实事件为锚点、双向的基准,用于评估职场智能体在开发运维、客服、财务、法务、医疗、人力资源和安全领域的这类决策。v2026-05 版本包含 106 个以公开事件为锚点的场景、成对的证据反转镜像场景和校准控制场景,标签在“继续”与“暂停”之间近乎均衡分布,使两个错误方向获得数量几乎相同的评估机会。模型看到提议的操作和可用证据,返回一个闸门决策,并依据其是否正确越过或守住边界来评分。在 30 个模型条件下,失败几乎完全集中于单一方向:模型在 28.1% 的机会中错误地暂停了已获授权、证据已通过审查的工作,而在 1.0% 的机会中错误地放行了不安全的工作。最难的案例是风险已化解的提交,即签名或结构化证据已经排除了一次真实的风险触发;模型在著名事件的证据反转镜像上的得分(63.8%)明显低于在事件本身上的得分(98.5%)。通用能力不等于转向校准:能力更强的模型往往在提交边界上过度拒绝,而更多的推理可以修复薄弱的闸门,却对已校准的闸门没有改善。公开排行榜见 steerbench.com。

SteerBench-Work:面向Agent行动边界转向决策的基准:论文配图
图1:SteerBench-Work 评估提交前动作边界(pre-commit action boundary),即智能体动作即将改变外部状态之前的那个决策。给定轨迹和候选动作,模型必须决定继续还是保持。在参考标签为保持时继续执行是拒绝不足(under-refusal);在参考标签为继续时保持是拒绝过度(over-refusal)。