论文

将LLM推理蒸馏为可解释策略树用于人机协作

Distilling LLM Reasoning into an Interpretable Policy Tree for Human-AI Collaboration

智能体系统Agent 环境交互

摘要

制定高效可靠的政策来帮助人类对于人类与人工智能的协作是必不可少的。现有方法主要遵循两条工作线。大多数先前的工作依赖于多智能体强化学习(MARL)来学习黑盒策略,这限制了可解释性并引发了安全问题。最近的方法在每个决策步骤查询大型语言模型(LLM),导致响应缓慢和推理成本较高。我们提出了协作策略树(Co-pi-tree),这是一种闭环方法,可学习由伙伴行为预测树和代理动作选择树组成的可执行策略树。 Co-pi-tree 通过将 LLM 推理提炼为策略树代码来构建策略。然后通过合作伙伴交互评估策略,获取反馈,并使用自然语言总结交互反馈以改进有问题的分支。 Overcooked-AI 中的实验表明,Co-pi-tree 将平均奖励比基线平均值提高了 35.4%,同时将 LLM 查询数量减少了 77.7%,测试时延迟减少了 97.1%。项目页面:https://beiwenzhang.github.io/Co-pi-tree/

将LLM推理蒸馏为可解释策略树用于人机协作:论文配图
图 1:左:MARL 方法在训练期间更新所有策略参数,并直接使用学习到的黑盒策略与人类协作。中:在线LLM代理不需要培训,但在做出每个决定之前都会查询LLM。右:Co-π\pi-tree利用LLM来定位和修改有问题的分支,并直接与人类一起执行细化的策略树。