论文
DEMM-Bench:面向智能体运行时治理证据充分性的跨体制基准
DEMM-Bench: A Cross-Regime Benchmark for Agent-Runtime Governance-Evidence Sufficiency
摘要
智能体运行时系统会产生轨迹、账本、溯源图、策略日志、委托词元、缓存事件和工具防火墙记录,但这些载体并不一定能回答关于某个具体决策的治理问题。DEMM-Bench是一个面向智能体运行时治理证据充分性的跨体制基准,建立在决策证据成熟度模型(Decision Evidence Maturity Model,DEMM)之上:它衡量跨八种证据体制的记录是否足以重建决策级属性,而不仅仅是记录在场。该基准通过适配器规范化各证据体制,就行为者、权限、动作、策略、决策依据、资源触达、生命周期上下文和验证强度提出属性问题,并施加八种确定性退化条件。在64个手工编制案例中,仅轨迹在场和仅模式在场的基线在75%的案例上过度声称,仅账本在场的基线过度声称50%,而经删改的属性级候选评分器过度声称率为零、平均属性充分性准确率为56.25%。存档包提供了64案例数据集、构建预言标签、基线和适配器,支持在异构智能体运行时证据底座上对决策证据成熟度进行可复现评估。