Proxy Confidence:用替代模型的对数概率审计黑盒 LLM 智能体
Proxy Confidence: Auditing Black-Box LLM Agents with a Surrogate's Log-Probabilities
摘要
部署中的 LLM 智能体会输出工具调用、查询和代码,而这些行动可能在没有明显报错的情况下出错;等错误暴露时,行动已经执行。前沿聊天 API 不公开模型的 token 概率;面对关键错误,智能体自述置信度只略优于随机水平;重复采样也难以奏效,因为前沿模型高度重复,往往再次输出同一调用。我们通过并行运行一个低成本开放权重替代模型,恢复缺失的信号。替代模型读取与智能体相同的上下文、schema 和拟执行行动,再用自身对数概率的多种互补读出方式为调用评分:教师强制与请求 PMI 衡量各参数值的似然,判别式判定评估整个调用,工具选择竞争则比较该函数与同组其他函数。应信任哪种方式取决于一条原则:生成式似然能够定位错误参数值,判别式判定能够捕获整体错误的调用。当错误类型未知时,集成是低遗憾的默认选择。此读出方法无需训练、不需要访问智能体内部,只需在工具调用旁增加一次预填充。在困难编程任务上,该方法的 AUROC 达到 0.825,而行动模型自述置信度接近随机水平,为 0.598;在另三个行动模型上,生成式读出提高 0.07—0.28。相对自一致性方法,在近乎确定性的行动模型上提高 0.14—0.19,而成本仅为其 1/K。此信号支持两种部署方式:实时门控将最不可信的调用送交复核,在 50% 覆盖率下使获准行动准确率提高 0.05—0.30;置信度反馈则把工具结果连同评分返回,让智能体调整下一步。在实际执行基准上,后者使任务成功率分别提高 0.119 和 0.137(p <= 1e-4);在步骤错误无显式提示的场景中,也优于随机评分对照 0.078(p = 0.003)。
