论文

基于TrustBench的安全智能体动作实时信任验证

Real-Time Trust Verification for Safe Agentic Actions using TrustBench

智能体系统Agent 动作执行与治理

摘要

随着大语言模型从对话助手演变为自主智能体,确保可信性需要从事后评估到实时动作验证的根本转变。现有框架如AgentBench评估任务完成情况,而TrustLLM与HELM则在生成之后评估输出质量。然而,它们都无法在智能体执行过程中阻止有害动作。我们提出TrustBench,一个双模式框架:(1) 使用传统指标与LLM-as-a-Judge评估对多个维度的信任进行基准测试;(2) 提供一个工具包,供智能体在执行动作之前调用来验证安全性与可靠性。与现有方法不同,TrustBench在关键决策点介入:在智能体制定动作之后、执行之前。领域专用插件为医疗健康、金融和技术领域编码了专门的安全要求。在多个智能体任务上,TrustBench将有害动作减少了87%。领域专用插件优于通用验证,多实现了35%的危害削减。凭借低于200毫秒的延迟,TrustBench使自主智能体的实用实时信任验证成为可能。

基于TrustBench的安全智能体动作实时信任验证:论文配图
图 1:TrustBench 双模式架构 (a) 基准测试模式使用 LLM 作为法官评估从特定领域的数据集学习置信度到正确性的映射。 (b) 运行时验证模式应用校准的先验和运行时检查来计算管理操作执行的复合信任分数。