论文
Frontier-Eng:基于生成式优化的真实工程任务自进化智能体基准测试
Frontier-Eng: Benchmarking Self-Evolving Agents on Real-World Engineering Tasks with Generative Optimization
摘要
当前的LLM智能体基准主要聚焦于代码生成或基于搜索的问答等二元通过/失败任务,往往忽视现实工程的价值,而这种价值常通过可行设计的迭代优化来体现。为此,我们提出Frontier-Eng,一个经人工核验的生成式优化基准——即在固定交互预算下,智能体生成候选工件、接收可执行验证器反馈并加以修订的迭代式提出-执行-评估循环——覆盖五大工程门类共$47$个任务。与以往套件不同,Frontier-Eng的任务建立在工业级模拟器与验证器之上,提供连续奖励信号并在受限预算下执行硬性可行性约束。我们使用代表性搜索框架评估了八个前沿语言模型,发现尽管GPT 5.4取得最稳健的表现,该基准对所有模型而言仍具挑战性。我们的分析显示改进频率($\sim$ 1/迭代次数)与改进幅度($\sim$ 1/改进计数)呈双幂律衰减。我们进一步表明,虽然宽度提升并行性与多样性,深度对在固定预算下获得来之不易的改进仍然至关重要。Frontier-Eng为评估AI智能体将领域知识与可执行反馈相结合以解决复杂开放式工程问题的能力树立了新标准。
