论文

Pistis技术报告

Pistis Technical Report

模型训练强化学习Agentic RL

摘要

我们介绍Pistis模型家族,包括分别构建于Qwen3.6与Qwen3.5之上的27B与9B参数多模态大语言模型,通过一个通用且可扩展的后训练框架开发。该框架首先通过大规模多模态监督微调(SFT)建立坚实基础。在此SFT基础上,我们提出交错蒸馏与强化学习(IDRL),一种新的后训练范式,在单一训练循环中紧密集成在策略蒸馏与强化学习。通过在两个目标之间交替,而非孤立优化其一或以静态联合损失合并二者,IDRL带来更有效的知识迁移、更高的优化稳定性以及针对长时程Agent轨迹更精确的信用分配,在缓解常见能力权衡的同时取得更强性能。在两个模型规模上,该框架都产出两个专门变体:Pistis-Thinking,旨在强化深度多模态推理;Pistis-Agentic,额外纳入Agent轨迹数据以支持长时程规划、迭代推理与工具使用。Pistis-Agentic在多模态搜索上尤其出色。两个规模都超过对应的基座模型。除模型参数优化外,我们进一步提出Pistis-Auto-Harnessing(PAH),一种通过迭代优化自动改进Agent推理harness的系统级方法。实验表明,PAH在不更新模型参数、不增加交互预算的情况下提升模型性能。

Pistis技术报告:论文配图
图 1:Pistis 能力与性能概览。“理解与推理”面板将 Pistis-Thinking 与相应基座模型在 MathVista-mini、MM-Vet、HallusionBench、OCRBench、AI2D-test、RefCOCO+ testA、Charades-STA(64 帧)和 MVBench(8 帧)上进行比较(Lu et al., 2024; Yu et al., 2023; Guan et al., 2024; Liu et al., 2024; Kembhavi et al., 2016; Yu et al., 2016; Gao et al., 2017; Li et al., 2024)。“智能体与搜索”面板将 Pistis-Agentic 与相应基座模型在 MMSearch、BrowseComp-VL、LiveVQA、PinchBench、TreeBench、HRBench4K、LogicVista 和 MathVerse-mini 上进行比较(Jiang et al., 2024; Geng et al., 2025; Fu et al., 2025; Kilo Code, 2026; Wang et al., 2025a; Wang et al., 2025c; Xiao et al., 2024; Zhang et al., 2024b)。所有数值与表 4 和表 5 一致。