论文
从线程到轨迹:用于从 GitHub 问题讨论中提取社区知识的多 LLM 管道
From Threads to Trajectories: A Multi-LLM Pipeline for Community Knowledge Extraction from GitHub Issue Discussions
摘要
解决大型开源软件 (OSS) 项目中复杂的后期制作问题需要大量的认知工作,因为开发人员在此之前需要经历漫长、非结构化和碎片化的问题讨论线程。在本文中,我们提出了 SWE-MIMIC-Bench,这是一个使用自动多 LLM 管道根据原始 GitHub 讨论生成的问题轨迹数据集。与简单的总结不同,该管道利用一组闭源 LLM 来执行粒度任务:在了解外部链接资源的情况下分析单个评论,将评论分析分类为特定于标签的字段(例如,根本原因、解决方案计划、实施进度),并合成标签感知的轨迹,捕获整个讨论线程的结构化且连贯的叙述。我们的管道使用五种闭源 LLM 配置来实现不同的目的:标签分类、内联代码块和外部链接摘要、注释分析、标签特定字段分类和轨迹合成。通过从复杂的对话线程生成简洁可靠的轨迹,该系统可以帮助更广泛的软件工程社区的开发人员和研究人员理解经验驱动的问题诊断协作方法。此外,生成的轨迹可用于训练现代 LLM 代理,使其像专家开发人员一样思考和行动。我们在来自 SWE-Bench-Pro、SWE-Bench-Multilingual 和 SWE-Bench-Verified 数据集的 800 个真实 GitHub 问题上评估了我们的系统,在提取 734 个高保真推理轨迹方面取得了 91.7% 的成功率。