论文
FormulaSPIN:自然语言到电子表格公式生成的自博弈微调
FormulaSPIN: Self-Play Fine-Tuning for Natural Language to Spreadsheet Formula Generation
摘要
电子表格应用被全球数亿人使用,但写公式仍是显著障碍。现有方法依赖静态监督数据,在有限标注上很快饱和。本文提出FORMULASPIN,一个打破监督微调上限的自博弈框架:无需任何额外数据即可迭代自我改进。原版SPIN在该任务上失效:它一律惩罚每个不匹配的输出,导致执行等价的备选在一个样例中被当作负例惩罚、在另一个样例中却是真值,产生矛盾梯度。我们的框架利用公式生成的独特优势解决该问题:二元可执行性提供隐式监督,把语义错误与有效的风格变体分开。我们把训练表述为双人博弈:主玩家学会偏好真值公式胜过其先前版本的输出,而执行反馈把输出分入不同粒度——实现从语义正确到风格精炼的自适应课程。为进一步提高准确率,我们纳入ExecVote——一个语义级投票机制,自然处理多个有效表述。多基准实验显示FORMULASPIN取得最先进表现:NL2FORMULA上精确匹配74.9%、执行准确率87.1%,匹敌用额外偏好标注训练的模型,同时超过传统SFT与前沿专有模型。这些发现凸显自博弈应对稀缺数据任务的潜力,并为把它扩展到可执行域之外打开大门。