论文

开放性问题的自主研究:以电信工单检索为例的案例研究

Autonomous Research for Open-Ended Problems: A Case Study on Telecom Ticket Retrieval

智能体系统Agent任务评测

摘要

基于大语言模型的系统在问题解决和编程方面取得突破,推动了AI for Science的发展,可能取代人类在机器学习研究中的角色。然而,尽管已有完全自主端到端的机器学习研究框架,其成功应用通常局限于搜索空间狭窄的问题,如语言建模或生物医学机器学习基准。本文探讨如何将自主研究应用于解决开放性、行业级的机器学习问题,以电信工单检索为案例,该任务在表示方法、架构设计和训练数据生成方面具有高度自由度。我们发现,使用商业和开源智能体进行开放性问题的自主研究既具潜力也存在局限:在狭窄的超参数优化方面表现优异,但缺乏人类般的直觉与创造力,且需要较高的操作开销。即使在极低的人工监督下,自主研究也能在较短时间内(10周)达到约90%的最先进水平性能(Recall@1为0.34 vs. 0.38),远快于人工耗时(10个月)且成本较低(单次Cursor任务最高200美元)。实证研究表明,人类研究人员与自主研究框架应协同工作,以实现机器学习研究的最佳效果。