论文
Palmyra x6 技术报告:通过锚定监督 微调 进行后训练的代理工具使用模型
Palmyra x6 Technical Report: An Agentic, Tool-Use Model Post-Trained via Anchored Supervised Fine-Tuning
摘要
Palmyra x6 是一款针对面向企业的代理任务进行优化的 大语言模型。该模型由 后训练 构建,这是一个混合专家基础模型,具有锚定监督 微调,基于经过验证的合成工具使用轨迹的紧凑语料库,并通过 Muon + Adam 混合进行优化。配方是故意保守和故意控制的:626 个轨迹、单个 epoch、低学习率和冻结基数的 KL 锚点。该模型比 Writer Agent 之前的默认模型有了显着的进步,并且与公共基准上的几个最新模型相比,在 BFCL Core 上得分最高,为 0.785 美元,并发布了该组中最高的六个基准平均值。此外,在我们的偏差和安全性评估中,该模型已显示出相对于比较器而言具有竞争力或领先性。