论文

Phoenix:通过多代理 LLM 安全解决 GitHub 问题

Phoenix: Safe GitHub Issue Resolution via Multi-Agent LLMs

智能体系统Agent 架构与控制循环

摘要

我们推出了 Phoenix,这是一个多代理 LLM 系统,可解决从分类到拉取请求创建的 GitHub 问题,将七层安全控制与基线感知测试评估策略相结合。 Phoenix 将工作分解为六个专业代理。规划者、重现者、编码者、测试者、故障分析师和拉取请求 (PR) 代理,所有这些都由基于标签的 GitHub Webhook 状态机进行协调。在打开拉取请求之前,会根据基线测试运行检查每个更改。在 SWE-bench Lite 的 24 个实例切片上。在生产 Webhook 路径上运行时,Phoenix oracle 解决了 75% 的实例,在成功运行时没有传递到传递的回归;这个策划的切片不能直接与完整的排行榜结果进行比较,我们讨论了比较的局限性。对 14 个存储库中的 42 个实际问题进行的补充试点产生了 100% 的正确性保留(CP;硬层上的平均 122 个)。手动检查显示,大约一半的拉取请求是有针对性的修复。另一半将代码放置在错误的路径上,这是我们正在通过检索解决的规划器本地化限制。我们还报告了激发每种安全机制的部署失败模式(WAF 过滤、词元过期、权限边界、片状 CI)。