论文
G-CARB:组合危害的图局部化共形智能体风险预算
G-CARB: Graph-Localized Conformal Agent Risk Budget for Compositional Harm
摘要
小语言模型 (SLM) 智能体需要安全控制来跟踪工具调用的后果,而监控开销很小。例如,当稍后的操作将该数据发送到系统外部时,私有读取就会成为泄漏。我们引入了 CARB(Conformal 智能体 Risk Budget),它使用停止前发生的伤害分类来校准何时停止智能体。在可交换事件下,标准保形风险控制限制了校准和未来事件的预期损失。 G-CARB 根据从私人来源到传出行动的可观察依赖关系选择评分证据。账本仍然涵盖整个执行历史,并且计算门分数不需要额外的语言模型推理。在使用两个 14B 骨干模型的 AgentDojo 重放中,G-CARB 在中等风险预算下将评分者输入记录大致减半,同时相对于全前缀评分提高了自主任务完成度;相同大小的随机上下文获得相似的增益。受控示例显示保留相关依赖性如何可以进一步避免停止良性工作。