论文
修正什么时候变成修复?使用工具的大语言模型内部干预的机械审计
When Does Correction Become Repair? Mechanistic Auditing of Internal Interventions in Tool-Using LLMs
摘要
在调用外部工具之前,Agentic LLM 必须在 K 路操作空间中进行选择:执行呼叫、寻求澄清、直接回答或拒绝。虽然内部激活指导可以改变这些执行前的决策,但传统的总体指标掩盖了改变后的状态的落地位置以及它们造成的附带损害。我们提出了 SAKIKO,一个审计框架,它通过定向错误发现、路由器条件干预、目的地解析验证和前瞻性冻结统计许可来形式化表示修复。在 When2Call 和 MetaTool 的七个大语言模型中,渠道关键干预措施在五个模型中带来了特定方向的净收益;在三项密封评估中,59 个预算匹配的随机方向没有一个与校准的目标增益相匹配。至关重要的是,目的地审计表明,行为变动并不等于修复:实现+55净收益的干预会破坏其所涉及的一半以上的基线正确决策,并且由于有限样本的不确定性,对Qwen3-4B和Gemma-2-9B的有希望的点估计被正式拒绝。 SAKIKO 确立了在要求内部修复之前进行结果解决裁决的必要性。代码:https://github.com/ruizheliUOA/mechanistic-tool-use-llm.