论文

SimVerity:模拟中的智能体成功何时能在物理部署中成立?

SimVerity: When Does Simulated Agent Success Survive Physical Deployment?

智能体系统Agent任务评测

摘要

模拟评估被广泛用于给AI智能体做基准测试,但一次模拟通过能为物理部署提供多少证据尚未被系统量化。我们提出SimVerity,一个判定迁移保证框架:它在目标智能家居部署上重放匹配场景,并将智能体执行与独立合格的物理见证进行交叉验证。我们的评估强调,部署成功是一个真实世界过程而非模拟中的静态属性:完成、报告状态、可观察效果和最终结果会在同一次执行中产生分歧。尽管一个先进模拟器通过了全部240次灯光试验,摄像头仍捕获到42次亚秒级失败,这些失败对最终状态检查不可见。错误放行是可预测的:一个从实测试验中学习并在评估前锁定的风险画像,预测了它从未物理测量过的路径上的失败,在两个批次的全部十一个留出会话中击败属性盲基线。智能体可审计性也可测量:更换一个智能体循环的模型客户端/服务配置,将其场景匹配份额从52-88%提升到100%。最后,第二个合格模拟器没有提供独立交叉校验:它从未在任何重叠案例上产生分歧,只有物理测量暴露了它们共同的盲点。SimVerity将判定迁移变为显式决策:在部署前放行、弃权或升级。

SimVerity:模拟中的智能体成功何时能在物理部署中成立?:论文配图
图1:经插桩的智能家居部署。