论文

STOCKTAKE:以公平预言机度量LLM智能体中感知与行动的差距

STOCKTAKE: Measuring the Gap Between Perception and Action in LLM Agents with a Fair Oracle

智能体系统Agent任务评测

摘要

LLM智能体日益在多周决策任务上被评估——其中驱动成本的状态从未被直接观察。在此类任务上,最终成本无法说明智能体为何失败:它可能误读了世界,也可能读对了却仍未能行动(知行差距)。既有评估无法分离这两种失败:其参照策略要么读取智能体从未见过的特权信息,要么完全缺失。我们提出STOCKTAKE:一个26周供应链补货基准——构建为含六个隐藏因子过程的分解部分可观测马尔可夫决策过程,设计上使公平参照策略可计算:逐因子的精确贝叶斯滤波器在智能体收到的同一观测流上驱动rollout策略。把每次运行在“无视症状的base-stock地板(0)”与该预言机(1)之间打分得到技能分;对每周书面理由评分得到陈述信念检测滞后与知行率——状态估计与控制被分别度量。在带精选压力画像的五十个种子上:Claude Sonnet 5、GPT-5.4、DeepSeek-V4-Pro与Grok 4.5检出84–88%的隐藏失败(通常在发生后一周内),但技能分横跨0.62到-0.23——四者中两个低于症状盲地板,而其命名因子的速度略快于胜出的两个。失败有两副面孔:压力持续处,每个模型都有34–43%的正确诊断压力周仍以缺货告终——该比率部分反映了模型注意到的那几周的严重性;该比率还与技能反向:低于地板的两个模型在诊断周缺货最少,因此响应不足只是差距的一面,其轨迹指向另一面——成本超过其所保护价值的响应。STOCKTAKE度量该失败的两个方向。