论文
用于嵌入式软件开发的 LLM 代理的闭环评估
Closed-loop evaluation of LLM agents for embedded software development
摘要
大型语言模型 (LLM) 越来越多地部署为编码代理,用于编辑文件、运行构建和测试、检查执行结果以及迭代修复软件。嵌入式固件是一个要求很高的目标,因为正确性取决于感测、时序和安全约束下的闭环行为,而不仅仅是静态源质量。然而,嵌入式代理评估仍然有限,并且通常强调一次性综合或离线正确性。我们提出了嵌入式编码代理闭环评估的基准。每个任务都提供纯文本工程描述、受限工作空间以及可见的构建和运行时界面。代理必须将需求转化为实施和自我验证步骤,然后进行迭代,直到实现所需的设备行为。该套件包含五个嵌入式控制任务和四个反馈场景:一次性生成、现实自我验证、CI 风格的红/绿反馈和预言风格的详细反馈。该实现的目标是模拟 ESP32 固件以实现可重复性。我们评估了七个 GPT 系列并 Qwen 系列配置涵盖五个任务和四个场景,每个条件重复 3 次,运行 420 次。 gpt-5.4 在评估的配置中具有最高的通过率,但未达到基准饱和; qwen3.5-27B是观测到的最强的局部模型;较小的局部模型的通过率和搜索效率急剧下降。这些结果表明,有能力的本地嵌入式编码代理正在出现。