论文
超越总体风险:LLM 工具调用的角色分层保形风险控制
Beyond Aggregate Risk: Role-Stratified Conformal Risk Control for LLM Tool Calls
摘要
语言模型代理通过结构化工具调用进行操作,其参数具有截然不同的风险:不受信任的内容可以合法地塑造电子邮件正文,但永远不应该设置收件人、帐户、命令或凭据。现有的保形风险控制方法将工具调用作为一个整体进行认证,因此一个罕见的高风险领域的失败可以通过周围的许多良性论点来平均化,从而使造成伤害的论点未经认证。我们引入了角色分层的每字段共形风险控制,这是一个校准层,它包装任何每字段检测器,并为每个语义参数角色分配单独的阈值和风险预算。我们表明,聚合认证付出了粗糙度的代价,根据该角色出现的频率按比例收紧了稀有角色的有效预算,而角色分层校准则直接通过有限样本保证来认证每个充分采样的角色,并汇集了最稀有的角色。在具有六种语言模型的 AgentDojo 和 InjecAgent 中,我们的方法在我们在模型和攻击转移、检测器噪声、渐进漂移、看不见的工具套件和自适应攻击下评估的方法中实现了最一致的特定于角色的预算合规性,在可交换性或重新校准后提供正式的每角色保证。这些结果表明,结构化工具调用应该在语义角色级别进行认证,而不是整个操作。