论文

生产云技能是否经过充分测试?在实践中衡量和管理技能测试的充分性

Are Production Cloud Skills Adequately Tested? Measuring and Governing Skill Test Adequacy in Practice

模型评测评测方法与指标

摘要

云平台越来越多地提供可重用的云技能,指导人工智能代理完成多步骤资源操作、用户选择、验证和恢复。现有技能评估主要衡量技能是否可以提高任务成功率,但通过可用的测试用例并不能揭示技能指定的哪些行为尚未经过测试。我们引入了技能测试充分性,这是一种场景条件标准,用于根据技能指定的完整操作测试义务集来评估测试套件。给定一个技能包和包含提示、初始资源状态和预期用户决策的规范化测试用例,评估确定每项义务是否由至少一个测试用例场景执行;生成的记录提供了套件级别的分数和明确的测试差距。我们通过并行义务提案、保留分歧的聚合、测试用例级状态提案、专家评审和基于源的建议来实施该标准。阿里云将此流程部署为任务成功评估和后续发布检查之前的强制关卡。在门驱动修复之前记录的 157 项初始评估中,57 项 (36.3%) 低于强制的 80% 门限,76 项 (48.4%) 仍低于建议的 90% 水平。该流程还生成 132 份报告,其中包含 639 项义务级别建议,其中每项技能的中位数为 4 项。最后,我们发布了 SkillAdeqBench,这是用于研究自动充分性评估的审查记录的探索性子集。技能测试充分性通过明确未经测试的生产云技能范围来补充任务成功评估。