TRUSS:迈向任务可靠与用户安全的自动化 Agent Skill 生成
TRUSS: Towards Task-Reliable and User-Safe Automated Agent Skill Generation
摘要
Agent Skill 将可复用的自然语言流程与可执行资源打包,使软件智能体无需模型适配即可获得任务特定能力。自动生成此类 Skill 可以提升任务表现,然而仅凭产物本身或最终任务结果评估候选,无法解决随之而来的问题:装备该 Skill 的智能体会执行哪些动作、这些动作会产生哪些副作用。我们提出 TRUSS,一个以证据为引导、生成功能有效且安全可靠的 Agent Skill 的框架。TRUSS 首先对照源证据与领域证据审查功能性声明,同时在九个预定义安全属性下评估完整产物。通过该静态门控的候选由一个影子智能体在可控执行环境中加载,其中受代理的工具将所请求的动作暴露给策略执行,并把结果记录为保留出处的执行轨迹。功能失败与属性违例被回溯到相应的 Skill 内容,并用于指导迭代改进。我们在 168 个 SkillInject 产物、155 个 SkillSafetyBench 案例以及 SkillGenBench 全部 187 个任务上评估 TRUSS。TRUSS 在漏洞检测上达到 100.00% 精确率与召回率。修复使攻击成功率在 GPT 5.5 上从 38.71% 降至 19.35%,在 GPT 5.4 上从 46.45% 降至 29.68%,且零攻击回退。在 Skill 生成上,TRUSS 将任务有效性从无 Skill 时的 17.11% 提升至 52.94%,同时把基准 Security 率从 50.80% 提高到 100.00%。这些结果表明,执行证据能暴露产物检查遗漏的行为失败,并可引导 Skill 生成同时达成经核证的功能与安全结果。
