论文

用小型策略模型个性化LLM Agent

Personalizing Large Language Model Agents with Small Policy Models

智能体系统上下文与知识记忆Agent 架构与控制循环Agent记忆

摘要

大语言模型(LLM)代理可以检索记忆、调用工具、提出澄清性问题,并且可以调整响应风格,但要适应个体用户执行决策仍然困难。为专用系统单独微调一个LLM的成本高昂或不可能,而提示和记忆主要暴露给代理,而不是从反馈中适应其执行决策。我们把冻结的代理个性化看作是基于对执行动作的单个标量反馈进行的用户特定执行策略的学习。我们提出FABLE(因子化适应性层),这是一个位于潜在黑盒主机代理外部的轻量级策略层。FABLE将记忆、信息获取和响应决策因子化,以便反馈更新相关选择;通过外部指定的可行集过滤行动,然后进行探索;通过贝叶斯上下文中的泰森采样法,学习相对固定的基础和成本分数的用户特定残余偏好。在线性残余奖励模型下,一个校准后的变体继承了与最佳可行行动相比的预期后悔界限。我们还描述了在持续可行性的约束下无法识别的偏好,并提供随时有效的真实推荐控制。在个性化推理、控制反馈和可执行工具使用评估中,FABLE相对于规则控制在相对偏好敏感的行为上有所改进,同时在整体任务性能上保持竞争力。

用小型策略模型个性化LLM Agent:论文配图
图1:冻结宿主模型周围的 FABLE:初始化阶段建立残差偏好后验;硬约束将选择范围限定为 A_t;残差化反馈在线更新该后验。