论文

超越正确性:通过具有代理判断的可扩展标签增强代码 LLM 中的架构推理

Beyond Correctness: Enhancing Architectural Reasoning in Code LLMs via Scalable Labeling with Agentic Judgment

模型训练合成数据

摘要

LLM 极大地改进了软件工程,但实际开发需要架构理解。手动标记这种理解的成本极其昂贵,而且不可能仅通过测试来验证。我们提出了一个代理判断管道,使用强大的 LLM 作为专家架构评估的可扩展代理,包括两个判断器:架构复杂性判断器(ACJ),它估计对任务需求的特定于代码库的架构理解;以及架构质量判断器(AQJ),它通过基于源代码的标准来评估补丁与存储库特定架构约定的一致性。 微调 Qwen3-8B/14B/32B 在 3,360 个精选实例上在 SWE-bench Verified 上实现了高达 27.2% 的解决率 - 比基本模型高出 540%,比未经过滤的 微调 高出 256%。同时,经过训练的模型实现了强大的跨语言泛化和架构补丁质量的持续改进。