论文

AI智能体知道任务何时简单吗:迈向复杂度感知的推理与执行

Do AI Agents Know When a Task Is Simple? Toward Complexity-Aware Reasoning and Execution

智能体系统Agent 规划Agent Harness

摘要

大语言模型(LLM)智能体日益自动化多步工程与信息学工作流,却很少追问一个任务实际需要多少工作量。它们常遵循“最大上下文优先”策略——重读已见过的文件与依赖——把一行编辑变成小型代码库审计。我们论证缺失的能力是任务感知的执行范围估计:在投入预算前判断任务难度、其真正需要的信息、以及最短可靠路径。我们形式化最小充分执行与智能体认知冗余比(ACRR),并提出E3(估计、执行、扩展):智能体估计初始工作点、执行最小可行路径、仅在验证失败时扩大范围。在MSE-Bench——能力受控模拟器中121次编辑的确定性基准——上:E3匹配最强基线的100%成功率,同时削减成本85%、token 91%、检查文件92%,并进一步以16%的优势胜过强自适应检索基线;增益在留出的指令措辞与几乎所有成本加权下成立。配套的真模型治控(LLM-Case)在实时gpt-4o编辑真实开源库上证实该效应——每个候选补丁都以实测oracle真实运行项目pytest套件评分:过度阅读较温和但真实,E3是可比任务成功率下最精简最快的策略——其唯一短缺是供应商限速而非错误编辑。我们把这框定为执行冗余的受控探针而非对任何已部署智能体的测量,并把任务感知执行定位为迈向工程落地AI(EGAI)的一步——智能体的努力锚定在任务的工程现实中。框架与基准已发布。

AI智能体知道任务何时简单吗:迈向复杂度感知的推理与执行:论文配图
图 4:冗余和安全网剖析。 (a) 激励性的 Gmail 图标任务以运行成本轨迹展开:Max-Context-First 的成本在检查所有七个项目文件时逐步攀升,自适应检索基线仍然需要完全读取一个检索到的文件并运行繁重的检查,而 E3 在预言机附近的少量操作中达到了经过验证的编辑。 (b) 对所有 121121 个任务的估计器校准(行:真实复杂度级别;列:估计难度 d^\hat{d}):透明估计器在 1-2 级和明显的 3 级任务上是准确的,并故意缩小 1818 个欺骗性 3 级任务的范围(突出显示;预测难度为 22 而不是 33)——正是 Expand 阶段恢复的情况,这就是乐观估计是安全的原因。