论文

Apodex 1.1:为复杂工作扩展Agentic智能

Apodex 1.1: Scaling Agentic Intelligence for Complex Work

智能体系统Agent 协作Agent Harness

摘要

通用语言模型能推理与综合知识,但复杂工作还需要与文件、信息源和可执行代码持续交互,以及状态维护、故障恢复和可验证交付。我们称之为工作能力(working capability):朝着真实世界目标持续、可验证地推进。Apodex 1.1沿两个互补维度发展这一能力。环境扩展(Environment Scaling)扩大可执行文件、搜索和代码环境的多样性与可验证性,而Agentic协调扩展(Agentic Coordination Scaling)训练智能体分解长视界任务、并行委派工作、整合异步结果并重新规划。共享执行harness与AgentOS跨工具和智能体维护任务状态与溯源,训练则把环境轨迹和协调轨迹转化为可靠行为。在复杂专业工作、金融、科学研究、数学、编码和搜索等领域,Apodex 1.1尽管使用的模型比许多前沿系统小得多,仍达到领先性能带。35B参数的Apodex 1.1 Mini进一步以可本地部署的形态保留了强工作能力。这些结果将Agentic智能建立在随时间完成的有用、可验证工作之上,并推进了我们打造面向雄心勃勃、长时间运行任务的重型求解器(Heavy-Duty Solver)的目标。

Apodex 1.1:为复杂工作扩展Agentic智能:论文配图
图5:HDS6 能力分类与过程分级流程。六个能力组各含四个评分细则项;诚信门控独立于加权评分细则应用。