论文
DocOps:自主智能体复杂文档操作的可验证基准
DocOps: A Verifiable Benchmark for Autonomous Agents in Complex Document Operations
摘要
随着自主智能体快速演化,可靠操纵无处不在的数字文档的能力,已成为实现通用AI助手与自动化复杂工作区工作流的关键。本文提出DocOps,一个确定性可验证的评估框架:以层级分类为底座,把受现实实践启发的文档操作解构为原子维度与递升的工作流复杂度。基于DocOps,我们系统评估代表性闭源与开源模型在各种智能体治控下的表现,揭示即使最先进的前沿配置在处理高度耦合、长程任务时仍存在深刻局限。对现有智能体操纵行为的细粒度分析进一步发现三种关键失败模式:长期状态跟踪崩溃、浅层语义验证与对结构元数据的破坏性编辑。最终,我们的工作暴露智能体在维护全局文档一致性上的能力边界,为面向复杂数字生态的稳健、非破坏性智能体的未来设计提供启示。
