论文

超越下一token预测:Atlassian工作台上工具使用Agent的RLVR概念验证

Beyond Next-Token Prediction: An RLVR Proof of Concept for Tool-Use Agents on Atlassian Workflows

模型训练强化学习RLVRAgentic RL

摘要

大语言模型的训练目标是预测下一token——而非在特定API内行动。在利基企业SaaS工作流中——成功意味着以正确的嵌套参数、按正确顺序命中正确端点——这种目标失配表现为静默失败:丢失必填字段、幻觉工具——或单次读取后提前停止。我们追问:直接在目标环境中应用可验证奖励强化学习(RLVR)能否弥合该差距。作为概念验证——我们构建五个模拟Jira REST v3与Confluence v2 API(达模式保真度)的合成环境套件;奖励完全从工具调用踪迹计算——环中无真实API、无学习裁判、无人工标注。以驱动GRPO训练的相同检查器对提示版Qwen3-1.7B与Qwen3.5-4B评分——我们发现:在四个奖励非退化的场景中——RL训练的策略将平均奖励从4B基线的0.35-0.92区间提升到0.95-1.00——单点最大增益在Confluence页面创建(0.35→1.00)。我们将其定位为面向利基企业API的结果优化小模型的初步步骤——并强调研讨会读者应权衡的两个局限:手工构造可验证奖励无法扩展到本文报告的少数端点之外;且五个场景之一(工单流转)具有提示版4B已能满分拿到头的饱和奖励形态。