论文
隐藏的足迹:把存储作为LLM智能体评估的一等指标
The Hidden Footprint: Making Storage a First-Class Metric for LLM Agent Evaluation
摘要
LLM智能体基准度量任务完成、可靠性与推理成本,却不度量智能体运行在磁盘上留下的持久数据——日志、上下文快照、检查点与调试轨迹。我们提出AgentFootprint:一个跨框架的运行后智能体存储足迹基准。其序列化感知的指标套件度量总保留量、通道构成、重复、增长、可压缩性与会话历史可重建性。它针对一个测量陷阱:朴素的字节级测量会把重复低估一个数量级——数据库分页与JSON转义掩盖了重复内容。固定轨迹对照把智能体生成的逻辑体量与持久层放大分开:同一轨迹经七个持久化框架重放产生6.7倍的差异。在相同模型、工具与任务下,准确率均为100%的配置在保留字节上相差15.7倍,尽管其默认值支持不同的恢复与审计能力。三个全历史配置在重复观察压力任务上超线性增长。从108个实例规范化的SWE-bench Verified提交导出的轨迹,每实例跨三个数量级,且与解决率无可检测相关。内容寻址存储把保留量降低4.8–32.7倍,同时保持全部可重建性得分。结果确立持久存储是应与准确率和可重建性一并报告的资源指标。
