论文

Dyad:为大语言模型加入原生类型化动作决策

Dyad: Extending Large Language Models with Native Typed Decision-Making

模型推理模型训练强化学习判别式推理与决策Agentic RLJev

摘要

我们研究如何通过使用本机类型决策扩展大语言模型(LLM)来构建功能更强大的通用Agent。我们引入了 Dyad,这是一种架构,它通过环境条件动作编码器来增强预训练的 LLM,该编码器并行嵌入每个候选动作描述,然后根据 LLM 的内部状态对这些嵌入进行评分,以产生类型化动作的分布。通过将决策分解为不断变化的交互状态和特定于环境的动作语义的表示,Dyad 引入了归纳偏差,用于学习可重用的表示,同时即使在动作空间增长时也能保持动作评分的效率。我们研究了由环境交互驱动的两种互补的强化学习设置。在 LLM 冻结的情况下,仅训练动作编码器即可在四种未见过的环境中实现一致的增益,从而无需修改任何 LLM 参数即可实现模块化适应。联合优化这两个组件在不同的交互任务和模型规模上都优于传统的 RL 后训练,包括使用 9B 模型在 ALFWorld 上获得 3.80% 的平均绝对增益,同时提高常识、推理和编码。