论文

NeuroState-Bench:面向LLM智能体配置承诺完整性的经人类校准基准

NeuroState-Bench: A Human-Calibrated Benchmark for Commitment Integrity in LLM Agent Profiles

智能体系统Agent任务评测

摘要

仅看结果的评估无法充分说明被评估的智能体配置是否保持了一致求解多轮任务所需的承诺。NeuroState-Bench是一个经人类校准的基准,它通过基准定义的旁路查询探针而非推断的隐藏激活来操作化承诺完整性。发布的清单包含144个确定性任务和306个基准定义的旁路查询探针,涵盖八个受认知启发的失败族、成对的干净与干扰变体,以及三个难度区间。主评估涵盖32个配置,包含一个固定的16配置本地子集与一个规模匹配的16配置托管大模型子集,二者经同一基准流水线评估。人类校准采用最终合并的报告范围:104个抽样任务单元、216条原始标注和108行裁定后的任务记录,加权kappa = 0.977,ICC(2,1) = 0.977。实证上,在这个扩展的模型网格中任务成功与承诺完整性出现分化:成功第一名并非完整性第一名,当以完整性取代任务成功时32个配置中有31个排名改变,且完整性排名在干扰扰动下更稳定。主要的无置信度分数HCCIS-CORE在探针后对最终任务失败的诊断判别上达到0.8469 AUC和0.6992 PR-AUC;先前的完整启发式变体HCCIS-FULL达到0.7997 AUC和0.6410 PR-AUC。探针准确率与状态漂移取得略高的ROC-AUC(0.8587)和更好的Brier/ECE,而HCCIS-CORE的点估计PR-AUC显著更高,且与基准意图刻画的结构关联更紧密。探索性的神经增强变体HCCIS+N整体较弱,随机化子空间对照则接近随机水平。因此,NeuroState-Bench贡献了一条经校准的评估轴,可在比原先仅本地子集更广的模型网格上暴露承诺失败。

NeuroState-Bench:面向LLM智能体配置承诺完整性的经人类校准基准:论文配图
图 1:主要论文中使用的 32 个配置文件评估网格的数据主导概述。 A 组总结了确定性基准范围和最终合并的校准核算,包括 144 个任务、306 个基准定义的侧面查询探针以及 104 / 216 / 108 个采样原始判定计数。图 B 将所有 32 个评估的配置文件直接显示为平均任务成功和平均 HCCIS-CORE 轴上的配置文件级别平均值,使用紧凑的系列支架代码和本地开放、托管前沿和托管开放子集分组;附录表 7 对这些紧凑配置文件代码进行了解码。