论文
代理存储库挖掘:多任务评估
Agentic Repository Mining: A Multi-Task Evaluation
摘要
挖掘软件存储库通常需要对提交、评论、代码行或整个存储库等工件进行分类。人工标记成本高昂且容易出错;有限的上下文经常导致标签的错误分类或不确定性。我们研究通过标准 bash 命令动态探索存储库的 LLM 代理是否可以与接收预先设计的上下文的简单 LLM 的分类质量相匹配。在四项任务、八种方法配置和 4943 种分类中,智能体尽管检索了自己的上下文,但仍实现了有竞争力的准确性。主要优点是鲁棒性:代理避免上下文窗口溢出并独立于工件大小进行扩展。对 100 个方法与 真值 不一致的案例的手动诊断揭示了在有限上下文下产生的规范模糊性和标签,这表明针对此类 真值 的准确性可能会低估具有更广泛上下文访问的方法。