论文
面向智能体间通信的可验证语义
Verifiable Semantics for Agent-to-Agent Communication
摘要
多智能体 AI 系统需要一致的通信,但我们缺乏验证智能体对所用术语理解一致的方法。自然语言可解释但易受语义漂移影响,学习得到的协议高效却不透明。我们提出基于刺激-意义模型的认证协议:在共享可观察事件上测试智能体,当经验性分歧低于统计阈值时术语获得认证。在该协议中,把推理限制在已认证术语上的智能体(“核心守护推理”)可获得可证明有界的分歧。我们还概述了检测漂移(再认证)与恢复共享词汇(重新协商)的机制。在不同语义分歧程度的模拟中,核心守护使分歧减少 72-96%。在用微调语言模型进行的验证中,分歧减少 51%。我们的框架是迈向可验证智能体间通信的第一步。
