论文
ProActor:面向主动式任务调度智能体的时序感知强化学习
ProActor: Timing-Aware Reinforcement Learning for Proactive Task Scheduling Agents
摘要
主动式面向任务的智能体必须自主预判用户需求、识别可行动机会并在恰当时机触发软件动作——这是对等待显式指令的反应式系统的根本性转变。然而,现有方法缺乏可泛化的端到端方案来度量与优化此类预见性行为。本文提出ProActor,一个面向对话式任务调度的统一框架,它整合了:(1) 一种领域无关的自动化标注方法,通过生成完整的时机时间窗口而非僵硬的点标签,实现可扩展的主动性强化学习(RL);(2) 同时刻画时机质量与参考动作对齐度的系统性主动性度量;(3) 使用GRPO并配合多种奖励设计的RL优化。我们的洞见是:基于RULER并带有主动性评分准则的奖励对提升时机质量至关重要,而由阶段感知复合奖励实现的主动性优化是平衡时机质量与参考动作对齐的关键。时序感知的RL需要大量探索,因而需要高效的基础设施。我们开发了ART-F,一个将请求自适应推理集群与单节点多GPU系统上基于DDP训练相结合的自适应框架,使4-bit的Qwen2.5-14B-ProActor-Q4能以4-8倍加速进行LoRA训练。在两个新自动标注数据集上的实验表明,主动性时机显著改善,同时动作一致性与最先进(SOTA)基线相当。消融实验验证了不同复合奖励变体的有效性。
