论文

AgentOmnia:面向全场景应用的智能体模型扩展

AgentOmnia: Scaling Agentic Models for Full-Scenario Applications

模型训练强化学习合成数据Agentic RL

摘要

大语言模型智能体进展迅速,但进展在领域、能力、任务难度与交互设置之间仍然割裂。我们将其框定为全场景智能体扩展(full-scenario agentic scaling),并提出AgentOmnia,一个在To-Consumer(ToC)、To-Business(ToB)与To-Employee(ToE)应用之间协调任务空间定义、数据合成、后训练、评估与改进的框架。一个可扩展的领域×能力×原子难度分类体系对齐这些阶段,并借助OmniaBench实现细粒度诊断。AgentOmnia将双向环境-任务合成与工具依赖、程序结构化及基于求解器的流水线相结合,构建了5,018个有状态环境、255,375个工具和52,361个任务。程序、求解器与验证器提供正确性信号,监督微调、在线智能体强化学习和回滚课程支撑后训练。评估失败被转化为产品需求文档(PRD),用于有针对性的自我演进。从Qwen3-30B-A3B-Thinking-2507出发,AgentOmnia把OmniaBench困难子集的通过率从9.16%提升到37.11%,并把OmniaBench、τ²-Bench、DeepPlanning与VitaBench的宏平均从22.86%提升到41.69%。在统一协议下,它在OmniaBench上领先于受评估的智能体后训练基线,并保持四个基准中最高的宏平均。它还在全部四个基准上超过Qwen3-235B-A22B-Thinking-2507,并在宏平均上超过Qwen3.5-35B-A3B。收益横跨三个应用切分、十个能力维度、八个原子难度因子以及90个一级领域中的76个,表明改进是广泛而非特定类别的。一项单轮研究为PRD引导的自我演进提供了初步证据,值得在更大规模和工业环境中验证。

AgentOmnia:面向全场景应用的智能体模型扩展:论文配图
图 15:从弱到强的数据合成和训练后范例的概述。从增强的可执行环境开始,AgentOmnia 将特权工具调用链合成为经过验证的、面向用户的任务,这些任务易于验证但难以解决,确保保留的样本既具有挑战性又可解决。在SFT中,能力感知的特权指导框架将用户交互建模与面向规划和结果的指导结合起来,为具有挑战性的任务合成准确、高效和多样化的监督轨迹。在 RL 中,基于混合规则和量规的奖励系统对推出轨迹进行评分,RCRL 根据所​​得奖励执行渐进式策略优化。随后,一个单独的轨迹分析系统执行故障模式分析和奖励黑客审计,从推出轨迹中识别能力差距,以细化奖励函数并指导目标训练实例的综合。