论文
评估分布式系统中的代理代码修复能力
Evaluating Agentic Code Repair Capabilities in Distributed Systems
摘要
基于 LLM 的 编码智能体 在单进程 SWE 任务上取得了快速进展,前沿模型现在在 SWE-bench Verified 上聚集在 70 左右。然而,分布式系统调试仍然是一个尚未得到充分探索的领域:错误跨越进程、节点和协议交互,根本原因很难仅从源头恢复,而且在非确定性交错中进行强力探索也很棘手。这在 LLM 和代理评估中留下了两个空白:没有针对分布式系统错误的代码修复基准测试,也没有受控研究来隔离外部提供的调试上下文对代理成功的影响有多大。我们引入了 DDBench,这是一个代码修复基准测试,包含从 13 个开源分布式系统中挖掘的 60 个历史错误,分为三个难度等级。 DDBench 在两个匹配条件下评估每个案例:仅症状条件,其中代理仅接收错误症状和存储库;以及上下文增强条件,其中它还接收有界调试上下文(日志、跟踪、运行时状态和目标代码调查注释),从而将调试上下文的影响与模型功能隔离开来。 DDBench 上十个 LLM 的评估揭示了几个发现。首先,分布式调试练习了单进程基准测试无法呈现的推理维度:模型的通过率跨度为 61 pp,并且成对引导程序在 DDBench 最难的案例集上以 p < 0.05 分离了 15 个顶级模型对中的 9 个。其次,有界调试上下文将总通过率提高了 +18.1 个百分点,并且提升是不对称的:较弱的模型获得通过率,而较强的模型获得效率。第三,调试上下文需要仔细管理,因为即使是忠实的调试上下文有时也会误导 LLM。