论文
SAGE-32B:通过迭代蒸馏实现Agentic推理
SAGE-32B: Agentic Reasoning via Iterative Distillation
摘要
我们展示SAGE-32B,一个专注于Agentic推理和长程规划任务的320亿参数语言模型。与追求通用对话流畅性的聊天模型不同,SAGE-32B被设计为在Agentic循环中运行,强调任务分解、工具使用和错误恢复。该模型以Qwen2.5-32B预训练模型初始化,并使用迭代蒸馏(Iterative Distillation)微调,这是一种通过严格测试的反馈循环提升推理性能的两阶段训练过程。SAGE-32B还引入逆向推理方法,利用元认知头在执行前预判规划过程中的潜在失败。在MMLU-Pro、AgentBench和MATH-500等Agentic推理基准上,SAGE-32B在多工具使用场景中相较同规模基线模型取得更高的成功率,同时在标准推理评测中保持竞争力。模型权重已在https://huggingface.co/sagea-ai/sage-reasoning-32b公开发布。