论文

ARC:开放式真实世界交互中的公平相对优势比较

ARC: Fair Relative Advantage Comparison in Open-Ended Real-World Interaction

模型训练强化学习Agentic RL

摘要

开放式真实世界交互允许多种有效行为:智能体可以直接回答、请求澄清、提供进度更新或在行动前确认。这种灵活性打破了基于分组的强化学习的一个核心假设:同一组内被比较的rollout不再保证行为上可比。结果,奖励模型对交互风格的偏好会扭曲相对优势,把优化引向奖励偏好的行为而非适合情境的行为。我们将这一问题正式化为“奖励公平性问题”,并提出ARC(Advantage Regularization via Conditioning,经条件化的优势正则化),一种通过策略条件化的rollout分组恢复更公平相对比较的训练配方,并辅以混合奖励与熵正则。我们在提出的inter范式中研究ARC,这是一种面向响应式、可引导、执行感知的用户-智能体交互新范式,它将用户可见的沟通与潜在推理及工具使用解耦。inter还提供了构建inter-86K的标注与蒸馏流水线——这是我们用于监督与RL训练的策略标注语料。实验上,ARC显著强化了核心τ/τ²工具使用基准表现,而inter相对think式基线将首token时间从4.91秒降至1.27秒。这些结果共同表明,开放式交互学习的核心瓶颈不仅在于如何奖励智能体,还在于其行为是否首先被公平比较。ARC实现与inter-86K训练数据将发布。

ARC:开放式真实世界交互中的公平相对优势比较:论文配图
图1:ARC 概览。ARC 对基于分组的强化学习进行了改造:训练时将每个样例与一条策略指令配对,使 rollout 只在以策略为条件的组内进行比较,通过消除跨策略污染而得到更干净的相对优势。推理时移除该指令,由策略自主选择策略,使 ARC 成为开放式交互中更公平优势估计的通用方案。