论文

AutoRecLab:描述实验,即可获得代码!

AutoRecLab: Describe the Experiment, Get the Code!

智能体系统Agent 架构与控制循环

摘要

实证评估是推荐系统(RecSys)研究的核心,但把实验设计转化为可执行代码仍是一项手动且易错的任务。我们提出AutoRecLab,一个基于Python的自主RecSys实验室,可从自然语言提示开始自动化RecSys实验。给定研究想法,AutoRecLab推导显式的实验需求,构建并验证原型,并迭代扩展为所需完整实验。该工作流结合了用于文档检索的检索增强生成(RAG)、静态类型验证与执行引导的树搜索。在演示中,AutoRecLab自主实现了一项显式-隐式反馈转换研究。在覆盖六个算法、三个数据集的基线比较中,使用GPT-5.4-mini时9次运行中8次成功,平均成本约1美元/次。

AutoRecLab:描述实验,即可获得代码!:论文配图
图 1:AutoRecLab 为显式到隐式转换实验生成的图。各面板报告在 MovieLens 1M 上不同算法与评分阈值(大于等于 1、大于 3、大于 4)下的 NDCG@10(上)和 Precision@10(下)。两张纵向堆叠的分组柱状图,每个反馈转换条件下各有三根柱。对于 NDCG@10,当评分大于等于 1 被转换为隐式反馈时 ItemKNN 最高,而在阈值大于 3 和大于 4 时 ImplicitMF 最高。对于 Precision@10,ItemKNN 在评分大于等于 1 和大于 3 时最高,而 ImplicitMF 在评分大于 4 时最高。流行度基线在所有条件下均最低,且当仅转换评分大于 4 的记录时,三种算法都达到各自最低值。