论文

HANDBOOK.md:长上下文智能体指令遵循基准

HANDBOOK.md: A Benchmark for Long-Context Agentic Instruction Following

模型评测上下文与知识智能体系统上下文工程智能体互操作协议Agent任务评测Agent Skills基准与评测资源MCP长程任务评测

摘要

语言模型智能体越来越多地在常设指令下部署:将系统提示词、政策文件或技能文档置于上下文中,并信任智能体让该文档约束其后续每一个动作。现有基准很少直接测试这种部署模式;它们衡量的是智能体能否完成任务,而不是一份冗长且具约束力的政策文档能否在较长的工具使用周期中约束其行为。我们提出HANDBOOK_md,一个包含65个智能体任务的基准,其建模方式模仿员工遵循公司手册。每个任务将智能体置于一个自成一体的公司环境(一个文件工作区,配有通过Model Context Protocol暴露的模拟电子邮件、聊天、日历、问题跟踪和商务服务)中,并指示它执行由专家撰写的20-124页标准操作规程所管辖的常规专业工作。任务覆盖五个领域(金融、医疗计费、保险、物流和人力资源)和10家虚构公司。为抵御记忆化,每个任务都修改10份基础手册之一,改变评分所依赖的具体规则与阈值,因此没有两个任务共享同一套政策。评分完全确定性:每个任务带有一组程序化评判标准(共824项),既检查必需动作确已发生,也检查禁止动作确未发生。在严格评分(即只有满足全部标准试验才通过)下,被评估的最强模型通过36.2%的试验,大多数前沿模型仍低于25%。失败呈现一致模式:智能体让看似合理但未经授权的环境内请求覆盖常设政策、执行必需检查后却违背其结果行事、在长周期中丢失规则细节,以及报告其并未实现的合规。我们发布任务、环境和评估框架。