论文

AgentDiff:意义重写引发比 LLM 代理中的表示变化更深的分歧

AgentDiff: Meaning-Bearing Rewrites Trigger Deeper Divergence than Presentation Changes in LLM Agents

模型评测鲁棒性、公平性与可信度评测

摘要

LLM 代理应该响应输入的含义,而不是其呈现方式。我们表明他们并没有平等地对待这两种变异。 AgentDiff 衡量由意义重写(释义和同义词替换)引起的答案更改和表示更改(重新排序、格式设置和干扰项)之间的差异,同时匹配扰动严重性。在 68 个模型-基准-支架单元中,涵盖来自七个架构系列的 10 个 LLM、三个基准、1{,}530 个原始问题和大约 11{,}150 个变体,有意义的重写会产生 $+19.69$ 个百分点的较高不一致率(配对 $t=9.58$,$p<0.0001$;64/68 个单元)积极)。结果在四个严重程度代理下保持稳定($+18.9$ 至 $+20.9$~pp,所有 $p<0.0001$),并且在 qwen 家族之外的 48 个细胞上保持 $+11.10$~pp。然后,完全保留的 qwen2.5-14B-Instruct 评估在 1{,}800 个新轨迹上测试此效应的结构:预先注册的有能力和可处理的分区在 3/4 保留的单元格中为正,并且在池化后保持急剧分离(Welch $t=3.81$, $p=9.6\!\times\!10^{-4}$)。迹线分析解释了差异如何传播。意义重写保留了第一个动作,但从步骤 2 开始减少了思想相似性 $5.6$--$10.5$ 点,并将生成的级联扩展了 $0.17$ 步(配对 $t=7.69$,$p=2.5\!\times\!10^{-14}$),我们将这种模式称为 \emph{隐形分歧}。因此,AgentDiff 建立了可重现的方向稳健性差距,识别最可靠的状态,并将最终答案的不一致与不同的轨迹级签名联系起来。代码、扰动、轨迹和分析脚本已发布以供审核:https://anonymous.4open.science/r/agentdiff-emnlp-0BB4/