论文

MedSkillAudit:面向医学研究智能体技能的领域专用审计框架

MedSkillAudit: A Domain-Specific Audit Framework for Medical Research Agent Skills

模型评测智能体系统Agent Skills评测方法与指标

摘要

背景:智能体技能正日益作为模块化、可复用的能力单元部署于AI智能体系统中。医学研究智能体技能需要超越通用评估的保障,包括科学诚信、方法学有效性、可复现性与边界安全。本研究开发并初步评估了一个面向医学研究智能体技能的领域专用审计框架,重点关注其相对专家评审的可靠性。方法:我们开发了MedSkillAudit(skill-auditor@1.0),一个在部署前评估技能发布就绪度的分层框架。我们评估了五个医学研究类别共75项技能(每类15项)。两位专家独立给出质量分(0-100)、有序的发布处置(Production Ready / Limited Release / Beta Only / Reject)以及高风险失败标记。系统与专家的一致性使用ICC(2,1)和线性加权Cohen's kappa量化,并以人类评分者间一致性为基准。结果:共识质量分均值为72.4(SD = 13.0);57.3%的技能低于Limited Release阈值。MedSkillAudit达到ICC(2,1) = 0.449(95% CI: 0.250-0.610),超过了人类评分者间0.300的ICC。系统与共识分的离散度(SD = 9.5)小于专家间离散度(SD = 12.4),且无方向性偏倚(Wilcoxon p = 0.613)。Protocol Design类别的类别级一致性最强(ICC = 0.551);Academic Writing类呈现负ICC(-0.567),反映了评分量表与专家之间的结构性失配。结论:领域专用的部署前审计可为医学研究智能体技能的治理提供实用基础,以针对科学用例定制的结构化审计流程补充通用质量检查。

MedSkillAudit:面向医学研究智能体技能的领域专用审计框架:论文配图
图 1:MedSkillAudit 框架概述 (skill-auditor@1.0)。输入技能工件(SKILL.md 和可选脚本)进入分层审核管道。结构审计层应用否决门 1(T1 操作稳定性、T2 结构一致性、T3 结果确​​定性、T4 系统安全性)并跨 25 个标准和 8 个符合 ISO 25010 的维度计算静态质量得分 (SstaticS_{\mathrm{static}})。特定领域的研究审核层在动态执行测试后应用否决门 2(M1 科学完整性、M2 实践边界、M3 方法基线、M4 代码可用性),通过两层评分标准(第 1 层通用,40 分;第 2 层特定类别,60 分)计算平均动态分数 (D´\bar{D})。无论分数如何,任何否决失败都会导致立即拒绝。最终质量得分为:最终得分 = 0.4×Sstatic+0.6×D¯0.4\times S_{\mathrm{static}}+0.6\times\bar{D}。发布处置分配给四个级别之一:生产就绪 (≥\geq85)、有限发布 (75–84)、仅测试版 (60–74) 或拒绝 (<60<60)。审计报告(步骤 7-8)输出结构化 JSON 和 Markdown,其中包含每个维度的分数、否决证据和技能改进的优化指南。