论文

智能体SE能耗系统比较

Engineering Sustainable Agents: A Systematic Comparison of Agentic LLMs for Developer Workflows

摘要

大语言模型日益用于软件工程,包括协调多个Agentic 智能体的智能体系统,但带来更高计算与环境成本。本文对五个软件工程任务上的智能体LLM系统做全面实证研究:代码生成、技术债识别、代码漏洞检测、日志解析与日志分析。对每个任务,我们比较从非智能体单查询基线到多智能体工作流的LLM配置,使用六个开放权重LLM、两种提示策略与三个硬件平台,按准确率、推理延迟与能耗评估。结果显示智能体复杂度与能效之间存在实质权衡:多智能体设计平均耗能是非智能体基线的6.36倍、耗时6.07倍,个别任务-硬件对最差减速至160倍。额外智能体带来的准确率收益有限且任务特定:多智能体改善了漏洞检测的平均准确率,但轻量非智能体与单智能体配置仍主导帕累托前沿,占66个帕累托最优配置中的59个。模型与提示选择是任务特定的杠杆,其有效方向随任务而变,并非全局默认值。我们将发现转化为面向可持续、任务感知LLM开发工具的设计指南。