论文

Kimi K2.5:视觉能力与并行Agent协作的联合训练

Kimi K2.5: Visual Agentic Intelligence

模型训练智能体系统模型评测强化学习Agent Harness基准与评测资源Agentic RL

摘要

Kimi K2.5把视觉理解、文本推理与Agent任务执行放入联合训练体系。在Agent Swarm中,主Agent把复杂任务拆成不同子任务,创建子Agent并委派执行,再汇总结果。并行Agent强化学习(PARL)只更新主Agent的策略;子Agent在训练期间保持冻结,其执行轨迹不进入优化目标。这种安排把任务分解与委派作为可训练行为,同时减少同时更新多个Agent带来的奖励归因与训练稳定性问题。 报告在编码、视觉、推理和Agent任务中评估模型,也比较了并行与串行执行。其重要性在于协作方式不再只是外部预设流程,而是可以通过任务反馈训练的模型决策。

Kimi K2.5:视觉能力与并行Agent协作的联合训练原论文图1
原论文图1:模型在所列基准中的能力比较。