论文
约束衰减:LLM 代理在后端代码生成中的脆弱性
Constraint Decay: The Fragility of LLM Agents in Backend Code Generation
摘要
大语言模型 (LLM) 代理在宽松的规范下展示了自主代码生成的强大性能。然而,生产级软件需要严格遵守结构约束,例如架构模式、数据库和对象关系映射。现有的基准测试经常忽略这些非功能性需求,奖励功能正确但结构任意的解决方案。我们提出了一项系统研究,评估代理在多文件后端生成中处理结构约束的能力。通过跨 80 个绿地生成任务和跨越 8 个 Web 框架的 20 个功能实现任务修复统一的 API 合约,我们使用端到端行为测试和静态验证器的双重评估来隔离结构复杂性的影响。我们的研究结果揭示了约束衰减的现象:随着结构要求的积累,智能体的性能表现出大幅下降。从基线到完全指定的任务,评估的配置的断言通过率平均下降 27.28 分。框架敏感性分析揭示了性能差异:中间层模型在最小的显式框架(例如 Flask)中取得成功,但在约定密集的环境(例如 FastAPI、Django)中平均表现要差得多。最后,错误分析将数据层缺陷(例如,不正确的查询组合和 ORM 运行时违规)识别为主要原因。这项工作强调,共同满足功能和结构要求仍然是 编码智能体 面临的关键挑战。