论文

隐藏的足迹:把存储作为LLM智能体评估的一等指标

The Hidden Footprint: Making Storage a First-Class Metric for LLM Agent Evaluation

模型评测智能体系统Agent Harness评测方法与指标

摘要

LLM智能体基准度量任务完成、可靠性与推理成本,却不度量智能体运行在磁盘上留下的持久数据——日志、上下文快照、检查点与调试轨迹。我们提出AgentFootprint:一个跨框架的运行后智能体存储足迹基准。其序列化感知的指标套件度量总保留量、通道构成、重复、增长、可压缩性与会话历史可重建性。它针对一个测量陷阱:朴素的字节级测量会把重复低估一个数量级——数据库分页与JSON转义掩盖了重复内容。固定轨迹对照把智能体生成的逻辑体量与持久层放大分开:同一轨迹经七个持久化框架重放产生6.7倍的差异。在相同模型、工具与任务下,准确率均为100%的配置在保留字节上相差15.7倍,尽管其默认值支持不同的恢复与审计能力。三个全历史配置在重复观察压力任务上超线性增长。从108个实例规范化的SWE-bench Verified提交导出的轨迹,每实例跨三个数量级,且与解决率无可检测相关。内容寻址存储把保留量降低4.8–32.7倍,同时保持全部可重建性得分。结果确立持久存储是应与准确率和可重建性一并报告的资源指标。

隐藏的足迹:把存储作为LLM智能体评估的一等指标:论文配图
图 1:AgentFootprint 管道:每个(框架、任务、重复)都在新的沙箱中运行;文件系统增量被分析为逻辑内容流而不是原始字节,产生驱动§5-§7的§3的六个指标。