论文
复制包质量评估的代理方法
An Agentic Approach Towards Replication Package Quality Evaluation
摘要
经验软件工程的可重复性依赖于完整的、可访问的和可重用的研究工件,但工件评估仍然主要是手动的并且难以扩展。这篇新兴结果论文探讨了一种通过将开放科学指南转化为机器可验证标准来评估复制包质量的代理方法。我们将来自 34 个来源的 380 项要求整合为 51 项可重复性标准,其中 31 项可用于基于工件的自动化评估。根据这些标准,我们实现了一个多代理原型,用于检查复制包并生成基于证据的改进报告。对五个复制包的初步评估显示,通过与手动基线的微平均一致性,运行间一致性高达 91.4% 和 75.4% 正确性。该代理在代码、环境和工件可用性等结构标准上表现最佳,但在定性或混合方法研究方面表现不佳。一项对七名软件工程研究人员进行的试点调查显示了良好的实用性和采用潜力,同时揭示了人机循环规划步骤中的认知负荷。总体而言,在这些小样本中,结果表明,代理研究工件评估有可能通过自动化选定的例行检查来支持作者和审稿人。