论文

自由派生,谨慎行动:递归大语言模型智能体树的渐进式风险授权

Spawn Freely, Act Sparingly: Progressive Risk Vesting for Recursive LLM-Agent Trees

智能体系统Agent 动作执行与治理

摘要

递归 LLM 代理可以通过产生专家来扩大搜索范围。一些分支稍后会请求发送数据或部署代码的工具。分支机构何时应获得采取行动的权力?我们将沙箱生成与能力激活区分开来,沙箱生成是指外部控制防止特定的损害,能力激活是指选定的分支跨越不可逆操作边界。渐进式风险归属 (PRV) 将轨迹级风险预算托管并在分支机构激活时记入借方。我们证明了自适应生成的树木随时都会受到伤害。分支结果可能是相关的,但每个本地证书需要在完整的预激活历史记录(包括用于选择请求的信息)的条件下保持有效。当激活门、分支费用和计算约束保持固定时,延迟兑现将保留不可撤销的生成费用下可用的每项策略。分支选择后,边际风险估计仍然可能失败。在程式化分支模型中,当权威再现数 $\mathcal{R}_A$ 越过 1 时,轨迹危害会发生变化。当局部风险 $p$ 接近零时,轨迹危害与低于临界值的 $p$ 成正比,与临界值的 $\sqrt{p}$ 成正比,并在其之上保留正下限。有限型占用模型会产生风险并计算影子价格。对于每单位风险边际价值递减的嵌套扇出模式,这些价格产生阈值规则。分支计算和分割样本实验说明了结果。这些综合研究并未评估已部署药物的安全性。分析提出了一个设计规则:在沙箱中广泛搜索并谨慎授予递归权限,并明确风险费用。

自由派生,谨慎行动:递归大语言模型智能体树的渐进式风险授权:论文配图
图1波森分支的数值计算。(a) 每起动损害时任何轨道损害的可能性p=0.005p=0.005;破折曲线标志了临界边界ms=1ms=1的权威。(b) 在三种生殖制度中,作为pp的函数计算损害概率。虚线显示亚临界和关键无症状。 两块数字研究。左侧面板是轨迹-伤害概率的热图,以平均沙箱破裂和权威激活概率为函数,并标出关键边界。右面板是次临界、关键和超临界系统中的危害概率的对数图。