论文

PreAct-Bench:LLM 中的基准预测监控

PreAct-Bench: Benchmarking Predictive Monitoring in LLMs

模型评测基准与评测资源

摘要

大语言模型 (LLM) 越来越多地被部署为能够针对给定目标执行多步行动轨迹的自主代理。虽然现有的安全研究侧重于从完整的轨迹中检测不道德行为,但这种范式从根本上来说是回顾性的:它仅在伤害已经发生后才识别伤害。在这项工作中,我们研究了一项关键但被忽视的安全任务,我们将其称为预测监控:仅给出部分行动轨迹,模型能否在执行公开行动之前推断出它是否会导致不道德行动?为了支持这项任务,我们提出了 PreActBench,这是一个跨越五个领域的 1,000 个配对道德和不道德行为轨迹的基准。我们使用 Prefix Foresight F1 指标评估一系列 LLM、安全护栏模型和跨动作轨迹不同部分的潜在探测方法。结果表明,虽然人类取得了有希望的表现,但即使对于强大的模型来说,预测监测仍然具有挑战性,这凸显了 LLM 安全中面向未来的风险推理的必要性。