论文

评估电子表格中下一步行动预测的基准和框架

A Benchmark and Framework for Evaluating Next Action Predictions in Spreadsheets

模型评测基准与评测资源

摘要

预测性代码完成大大加快了开发人员的工作速度。在电子表格中,尽管这种自动完成功能更为常见,但实际上并不存在。为了解决这一差距,我们引入了一个系统基准,用于观察电子表格中的一系列用户操作并预测未来的操作。两个挑战是(1)公共电子表格语料库中缺乏编辑历史记录,以及(2)电子表格操作的复杂空间(空间、时间、复合)。为了解决 (1),我们手动策划 52 个 12K 操作序列,这些操作从公共语料库重新创建电子表格,并通过参数化启发式和 LLM 细化进行播种。为了解决(2),我们提出了一种在线评估,它期望在每个用户操作后进行预测,接受或拒绝该预测,在接受后更新未来的操作,并重复此操作直到获得目标电子表格。我们使用多个基线预测器(包括零样本 LLM、微调 SLM 和经典模型),并分析基准测试告诉我们的不同属性,包括但不限于:已保存操作和误报的属性、效率、用户配置文件的影响、触发器的影响和上下文的影响。