论文

面向智能体间通信的可验证语义

Verifiable Semantics for Agent-to-Agent Communication

智能体系统智能体互操作协议

摘要

多智能体 AI 系统需要一致的通信,但我们缺乏验证智能体对所用术语理解一致的方法。自然语言可解释但易受语义漂移影响,学习得到的协议高效却不透明。我们提出基于刺激-意义模型的认证协议:在共享可观察事件上测试智能体,当经验性分歧低于统计阈值时术语获得认证。在该协议中,把推理限制在已认证术语上的智能体(“核心守护推理”)可获得可证明有界的分歧。我们还概述了检测漂移(再认证)与恢复共享词汇(重新协商)的机制。在不同语义分歧程度的模拟中,核心守护使分歧减少 72-96%。在用微调语言模型进行的验证中,分歧减少 51%。我们的框架是迈向可验证智能体间通信的第一步。

面向智能体间通信的可验证语义
图2:不同分歧条件下的不一致率与核心规模。(A)无防护(实心)与核心防护(阴影线)的不一致率对比。防护后的比率在所有场景中保持在约2%,而无防护比率随分歧增加而上升。(B)核心规模分布。随着分歧增大,能被认证的项更少:Noise-Only平均3.8项,Moderate Drift为2.6,High Divergence为0.2(95%为空核心)。虚线表示均值。