论文

Frontier-Eng:基于生成式优化的真实工程任务自进化智能体基准测试

Frontier-Eng: Benchmarking Self-Evolving Agents on Real-World Engineering Tasks with Generative Optimization

智能体系统Agent任务评测

摘要

当前的LLM智能体基准主要聚焦于代码生成或基于搜索的问答等二元通过/失败任务,往往忽视现实工程的价值,而这种价值常通过可行设计的迭代优化来体现。为此,我们提出Frontier-Eng,一个经人工核验的生成式优化基准——即在固定交互预算下,智能体生成候选工件、接收可执行验证器反馈并加以修订的迭代式提出-执行-评估循环——覆盖五大工程门类共$47$个任务。与以往套件不同,Frontier-Eng的任务建立在工业级模拟器与验证器之上,提供连续奖励信号并在受限预算下执行硬性可行性约束。我们使用代表性搜索框架评估了八个前沿语言模型,发现尽管GPT 5.4取得最稳健的表现,该基准对所有模型而言仍具挑战性。我们的分析显示改进频率($\sim$ 1/迭代次数)与改进幅度($\sim$ 1/改进计数)呈双幂律衰减。我们进一步表明,虽然宽度提升并行性与多样性,深度对在固定预算下获得来之不易的改进仍然至关重要。Frontier-Eng为评估AI智能体将领域知识与可执行反馈相结合以解决复杂开放式工程问题的能力树立了新标准。

Frontier-Eng:基于生成式优化的真实工程任务自进化智能体基准测试
图 1:Frontier-Eng 概述。顶部:我们将二元奖励代理基准(具有通过-失败类型结果的搜索/编码)与生成优化进行对比,其中代理反复提出代码编辑建议,接收验证者反馈,并在固定交互预算下进行改进。左下:Frontier-Eng 涵盖 5 个工程类别的 47 47 项任务,涵盖异构工件类型、目标结构和模拟器系列。右下:集成管道强制执行只读评估器、隔离执行、可行性验证和验证器解析评分,因此收益必须来自真正的解决方案改进,而不是奖励黑客。