论文
SciTrace:面向科学发现智能体的轨迹感知安全推理
SciTrace: Trajectory-Aware Safety Reasoning for Scientific Discovery Agents
摘要
基于大语言模型的科学Agent已经表现出了强大的自主研究能力,但他们的安全层在结构上仍然与核心推理脱节:他们检查管道输出,而不是塑造产生这些输出的审议。这种分离开启了两种故障模式:在一个阶段积累的安全信号在下一阶段之前被丢弃,并且单独的良性工具调用序列可能会产生单步过滤器无法检测到的有害结果。为了应对这些挑战,我们引入了 \textbf{SciTrace},这是一个将安全推理融入科学代理管道的每个阶段的框架。 SciTrace 结合了两种互补机制:一个 \textit{安全内在推理循环} (SIR),它通过联合任务和安全审议来维持思考者、实验者、编写者和审阅者阶段的累积风险状态;以及 \textit{组合工具链验证器} (CTV),它在执行之前执行轨迹感知安全检查,捕获仅在多步骤工具序列中出现的风险。 SciTrace 对跨越 6 个科学领域的 240 个高风险研究任务和 120 个与工具相关的风险任务进行了评估,在四个骨干模型的比较框架中实现了最先进的 (\textbf{SOTA}) 安全性:它持续改进了工具调用安全性和对抗鲁棒性,同时保持了科学输出质量,并且发现了单步监控器遗漏的 \textbf{78.8\%} 组合工具链逃逸。该项目网站位于 https://opensciagent.github.io/SciTrace/。
