论文
AgentCPM-Explore:为边缘规模智能体实现长程深度探索
AgentCPM-Explore: Realizing Long-Horizon Deep Exploration for Edge-Scale Agents
摘要
尽管基于大语言模型(LLM)的智能体在解决复杂任务方面展现出显著潜力,现有系统仍然严重依赖大规模模型,边缘规模模型的能力在很大程度上未被充分探索。本文对在 40 亿(4B)参数规模上训练 Agentic 模型进行了首个系统性研究。我们识别出阻碍边缘规模模型性能的三大主要瓶颈:监督微调(SFT)期间的灾难性遗忘、强化学习(RL)期间对奖励信号噪声的敏感性,以及长上下文场景中冗余信息导致的推理退化。为解决这些问题,我们提出 AgentCPM-Explore,一个具有高知识密度和强探索能力的紧凑型 4B 智能体模型。我们引入一个整体性训练框架,其特色包括参数空间模型融合、奖励信号去噪和上下文信息精炼。通过深度探索,AgentCPM-Explore 在 4B 级模型中取得最先进(SOTA)性能,在四个基准上追平或超越 8B 级 SOTA 模型,甚至在五个基准上胜过 Claude-4.5-Sonnet 或 DeepSeek-v3.2 等更大规模的模型。值得注意的是,AgentCPM-Explore 在 GAIA 文本类任务上于 pass@64 下取得 97.09% 的准确率。这些结果有力地证明,边缘规模模型的瓶颈并非其固有的能力上限,而是其推理稳定性。基于我们成熟的训练框架,AgentCPM-Explore 有效释放了边缘规模模型此前被低估的巨大潜力。
