论文

SciTrace:面向科学发现智能体的轨迹感知安全推理

SciTrace: Trajectory-Aware Safety Reasoning for Scientific Discovery Agents

智能体系统Agent 动作执行与治理Agent Harness

摘要

基于大语言模型的科学Agent已经表现出了强大的自主研究能力,但他们的安全层在结构上仍然与核心推理脱节:他们检查管道输出,而不是塑造产生这些输出的审议。这种分离开启了两种故障模式:在一个阶段积累的安全信号在下一阶段之前被丢弃,并且单独的良性工具调用序列可能会产生单步过滤器无法检测到的有害结果。为了应对这些挑战,我们引入了 \textbf{SciTrace},这是一个将安全推理融入科学代理管道的每个阶段的框架。 SciTrace 结合了两种互补机制:一个 \textit{安全内在推理循环} (SIR),它通过联合任务和安全审议来维持思考者、实验者、编写者和审阅者阶段的累积风险状态;以及 \textit{组合工具链验证器} (CTV),它在执行之前执行轨迹感知安全检查,捕获仅在多步骤工具序列中出现的风险。 SciTrace 对跨越 6 个科学领域的 240 个高风险研究任务和 120 个与工具相关的风险任务进行了评估,在四个骨干模型的比较框架中实现了最先进的 (\textbf{SOTA}) 安全性:它持续改进了工具调用安全性和对抗鲁棒性,同时保持了科学输出质量,并且发现了单步监控器遗漏的 \textbf{78.8\%} 组合工具链逃逸。该项目网站位于 https://opensciagent.github.io/SciTrace/。

SciTrace:面向科学发现智能体的轨迹感知安全推理:论文配图
图 1:轨迹感知安全推理。 SciTrace 使安全成为管道的内在特征:它跨阶段传播累积风险状态,并在执行前验证整个工具轨迹。相比之下,SafeScientist 将安全性视为阶段本地过滤器,因此在思考者阶段标记的双重用途风险会在本地缓冲,从不传播,而实验者在没有上下文的情况下继续发出可武器化的输出。相反,SciTrace 通过安全内在推理循环 (SIR) 保持早期 S2(双重用途生物学)警告在下游处于活动状态,而其组合工具链验证器 (CTV) 在执行前拦截危险工具序列,将代理重定向到安全替代方案(耻垢分枝杆菌),同时保持研究质量。