论文

智能体AI中的语义不变性

Semantic Invariance in Agentic AI

模型评测鲁棒性、公平性与可信度评测

摘要

大语言模型(LLM)日益在决策支持、科学问题求解和多智能体协调系统中充当自主推理智能体。然而,将LLM智能体部署于具有重大后果的应用,需要保证其推理在语义等价的输入变化下保持稳定,我们将这一性质称为语义不变性。标准基准评测评估的是固定、规范的问题表述上的准确率,无法捕捉这一关键的可靠性维度。为弥补这一不足,本文提出一个用于系统评估LLM推理智能体鲁棒性的变形测试框架,在横跨四种不同架构家族的七个基础模型上应用八种语义保持变换(恒等、改写、事实重排、扩写、缩写、学术语境、商业语境和对比表述),这七个模型是:Hermes(70B、405B)、Qwen3(30B-A3B、235B-A22B)、DeepSeek-R1和gpt-oss(20B、120B)。我们的评估涵盖八个科学领域的19个多步推理问题。结果显示,模型规模并不能预测鲁棒性:较小的Qwen3-30B-A3B取得最高的稳定性(79.6%的不变响应,语义相似度0.91),而更大的模型则表现出更强的脆弱性。

智能体AI中的语义不变性:论文配图
图 1:按变换类别组织的变形关系。每张卡片都显示原始问题文本及其语义保留转换,并突出显示关键修改。