论文

Spreadsheet-RL:通过强化学习提升大语言模型智能体在真实表格任务上的能力

Spreadsheet-RL: Advancing Large Language Model Agents on Realistic Spreadsheet Tasks via Reinforcement Learning

模型训练AI 基础设施强化学习SandboxAgentic RLAgent Sandbox

摘要

表格系统(如Microsoft Excel、Google Sheets)在现代以数据为中心的工作流中扮演核心角色。随着AI智能体在自动化复杂任务(如控制计算机、生成演示文稿)方面日益能干,构建AI驱动的表格智能体已成为一个有前景的研究方向。现有表格智能体大多依赖在通用LLM之上做专门提示;这一设计在简单表格操作上尚有潜力,却难以驾驭真实应用中典型的复杂多步工作流。我们提出Spreadsheet-RL,一个强化学习(RL)微调框架,用于在真实的Microsoft Excel环境中训练专用表格智能体。Spreadsheet-RL的特色包括:一条从在线论坛可扩展收集“起始-目标”配对表格的自动化流水线,以及金融、供应链管理等领域的领域专用评估任务,二者汇编成新的Domain-Spreadsheet基准数据集。它还包含为多轮RL设计的Spreadsheet Gym环境:该环境通过Python沙箱开放丰富的Excel功能,并配备精细的harness,内含面向表格任务的完整工具集与精心设计的工具路由规则。通过全面实验,我们表明Spreadsheet-RL显著提升了AI智能体在通用与领域表格任务上的表现:它将Qwen3-4B-Thinking-2507在SpreadsheetBench上的Pass@1从12.0%提高到23.4%,并在我们策划的Domain-Spreadsheet数据集上将Pass@1从8.4%提高到17.2%。这些结果凸显了Spreadsheet-RL在表格自动化上的泛化与落地潜力,更广泛地,也展示了其在推动日常工作中基于LLM的数据接口交互方面的前景。

Spreadsheet-RL:通过强化学习提升大语言模型智能体在真实表格任务上的能力:论文配图
图 2:Spreadsheet-RL 概述。我们根据真实的电子表格问题构建了一个强化学习数据集,其中包括自然语言任务描述、初始电子表格和预言机最终电子表格。政策LLM与 Spreadsheet Gym(真正的 Excel 环境)交互,通过交错推理和工具使用生成多步骤电子表格编辑。通过将预测的最终电子表格与预言机结果进行比较来计算奖励。 LLM 政策通过 GRPO 进行了优化。