论文

TDD-Agent:代码生成的测试驱动推理

TDD-Agent: Test-Driven Reasoning for Code Generation

智能体系统Agent 架构与控制循环

摘要

大语言模型 (LLM) 在代码生成方面取得了显着的进步,但确保复杂的存储库级任务的正确性仍然具有挑战性。现有方法通常使用生成的测试作为静态事后验证器,这限制了它们指导实施的能力,并且当测试本身不完整或不正确时可能会引入误导性反馈。在本文中,我们介绍了 TDD-Agent,它可操作代码生成的测试驱动开发范例。 TDD-Agent 首先提示模型生成可执行测试,鼓励其在实现之前阐明预期行为,然后使用执行反馈对生成的代码和测试进行迭代双轨细化。我们首先通过 LiveCodeBench 上的提示变体 TDD-prompt 隔离测试优先推理的效果,它持续改进基于推理的提示基线。基于这一发现,我们在 RepoEval(存储库级基准)上评估了完整的 TDD-Agent 框架,并表明它始终优于基于检索和基于代理的基线。其他分析表明,迭代细化不仅提高了代码的正确性,而且提高了生成的测试的有效性,产生更高的通过率、覆盖率和突变分数,这表明测试可以作为不断发展的推理工件而不是固定的验证器。我们的源代码位于 https://anonymous.4open.science/r/TDD-Agent-Framework-6370/。