论文

探索语言和非语言代理之间的协作

Exploring Collaboration between a language and a non-language agent

智能体系统Agent 协作

摘要

LLM 越来越多地被部署为协调器,协调专门的子代理以通过自然语言解决复杂的任务。然而,在游戏和机器人等许多重要领域,最强大的可用代理并不是语言模型。将非语言代理与 LLM 集成需要 \emph{语言化}:在每个交互步骤将其丰富的连续表示压缩为稀疏的文本摘要。为了研究语言化是否构成瓶颈,我们引入了 \textsc{LLAMIA-Bench},这是一套六种不同的协作国际象棋任务,涵盖三个方面:行为模仿、状态评估和自然语言解释。每个任务都实例化了一个成熟的国际象棋问题,LLM 和国际象棋引擎都无法单独解决该问题。为了解决 LLM 与非语言代理的协作问题,我们引入了 \emph{潜在状态内部化},它将子代理的连续表示作为学习状态词元直接投影到 LLM 的词元流中,并随着动作推进环境状态而进行动态重新编码。将内化与语言化整合进行比较,我们的实验揭示了一致的 \emph{语言化债务}:性能差距在整个训练过程中不断扩大,并且随着 LLM 从 4B 参数扩展到 14B 参数而持续存在。单个 14B 模型 \textsc{LLAMIA} 经过潜在状态内化训练,匹配或超过任务专家和前沿模型(包括 GPT-5.1),可在所有基准任务中使用工具访问,并概括特定于任务的微调崩溃的分布外情况