MedSkillAudit:面向医学研究智能体技能的领域专用审计框架
MedSkillAudit: A Domain-Specific Audit Framework for Medical Research Agent Skills
摘要
背景:智能体技能正日益作为模块化、可复用的能力单元部署于AI智能体系统中。医学研究智能体技能需要超越通用评估的保障,包括科学诚信、方法学有效性、可复现性与边界安全。本研究开发并初步评估了一个面向医学研究智能体技能的领域专用审计框架,重点关注其相对专家评审的可靠性。方法:我们开发了MedSkillAudit(skill-auditor@1.0),一个在部署前评估技能发布就绪度的分层框架。我们评估了五个医学研究类别共75项技能(每类15项)。两位专家独立给出质量分(0-100)、有序的发布处置(Production Ready / Limited Release / Beta Only / Reject)以及高风险失败标记。系统与专家的一致性使用ICC(2,1)和线性加权Cohen's kappa量化,并以人类评分者间一致性为基准。结果:共识质量分均值为72.4(SD = 13.0);57.3%的技能低于Limited Release阈值。MedSkillAudit达到ICC(2,1) = 0.449(95% CI: 0.250-0.610),超过了人类评分者间0.300的ICC。系统与共识分的离散度(SD = 9.5)小于专家间离散度(SD = 12.4),且无方向性偏倚(Wilcoxon p = 0.613)。Protocol Design类别的类别级一致性最强(ICC = 0.551);Academic Writing类呈现负ICC(-0.567),反映了评分量表与专家之间的结构性失配。结论:领域专用的部署前审计可为医学研究智能体技能的治理提供实用基础,以针对科学用例定制的结构化审计流程补充通用质量检查。
