论文
ODYSSE:面向个性化智能体推理的分回合策略优化
ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning
摘要
智能体系统在与真实环境交互、利用外部工具以及为用户提供服务的能力上迅速进步。然而,与假设指令明确定义的自然世界任务不同,以人为中心的场景以模糊请求为特征,这些请求导向庞大而开放式的解空间。因此,解读用户的个性化偏好对于收窄候选解空间至关重要。这引出一个新挑战——个性化智能体推理,它要求智能体同时与用户和环境交互以提供个性化服务。本文提出ODYSSE,一个面向个性化智能体推理的强化微调(Reinforced Fine-Tuning,RFT)框架。其核心是ODYSSE提出的Episode-wise GRPO(ESPO),这是对群组相对策略优化(Group Relative Policy Optimization,GRPO)的新颖扩展,旨在应对个性化智能体推理中的长动作时程与强跨步依赖。ESPO不再独立优化单个步骤,而是引入回合级奖励机制与回合式优势估计,使上游证据能有效引导下游个性化决策,并让智能体能在多个交互步骤中逐步厘清模糊的用户请求。我们进一步提出一个回合式批采样器,将同一回合的动作归入统一训练批次,以便在ESPO下进行连贯优化。我们在真实的长时程个性化GUI推理任务上评估ODYSSE。实验结果表明,ODYSSE持续超越专用与通用LVLM,凸显其在个性化智能体推理上的有效性。
