论文

ParanoiaEval:评测编码 Agent 的不必要防御

ParanoiaEval: Benchmarking Unnecessary Defensive Work in Agentic Coding

智能体系统Agent任务评测

摘要

编码Agent越来越多自主承担实际工作,风险处理是否适当成为独立问题。已有研究分散评测相关行为,缺少统一框架。ParanoiaEval以软件工程的规避、转移、缓解、接受四种风险处理为基础,构造200组仓库级任务对,每组只改变决定处理方式的证据。专门指标测量风险处理违规与证据响应,以人工校准的Agentic评审支持可靠评测。八个代表模型的大规模实验和事后人工研究显示:即使有明确证据,11.2%—58.7%运行仍存在不必要风险处理,配置差异很大;更强任务能力不保证处理更适当,违规会显著损害开发体验,因此风险处理是独立能力维度;系统性模式与已有风险管理研究相符,人类实践可指导诊断和改进。

ParanoiaEval:评测编码 Agent 的不必要防御:论文原图
图 2:ParanoiaEval 的构建流程。