论文
跨异构代理技能的证据校准运行时重建 编码智能体
Evidence-Calibrated Runtime Reconstruction for Agent Skills Across Heterogeneous Coding Agents
摘要
代理技能为使用语言模型代理的工具提供了可重用的指令和资产。渐进式加载创建的故障边界很难通过以会话、模型或工具为中心的跟踪来表示:技能可以被发现但无法激活,可以在没有指令的情况下激活,或者在没有独立验证结果的情况下显示为成功。我们提出了技能运行时智能,这是一种被动的运行时智能系统,它可以跨异构Harness重建受支持的技能生命周期阶段,同时将不受支持的阶段保留为未知。它的 Run Panorama 将不变事件、确定性关系、推断诊断和受控结果分为四个证据等级;可选的跟踪导入和 OTLP/HTTP 导出支持现有的可观察性部署。在 6 个冻结存储库配置文件、3 个 编码智能体 以及 7 个干净或故障注入条件中,所有 126 次执行都保留了源工作树,并且每一次都与一个源会话相关。然而适配器暴露了三种不同的语义:没有技能运行;完整运行但没有类似故障的事件;或每个操作故障和清洁会话中的类似故障事件。在七模板诊断研究中,语义别名和全景定位相同的六个非干净边界,但确切/状态行为不同;两个 Raw 视图都会在所有 18 个干净案例中发出失败状态,而 Panorama 则不会发出任何状态。已知规则图符合 126/126 个冻结合约,而第二个模型仅完成 228/378 个调用。这些观察结果激发了可执行适配器的资格认证,并表明事件存在不是边界保真度,复合精确分数掩盖了明显的错误,并且模型解释不得覆盖确定性事实。