论文

技能增广AI智能体用于医学研究分析:NSCLC转录组生物标志物任务的探索性多模型人类评估

Skill-Augmented AI Agents for Medical Research Analysis: An Exploratory Multi-Model Human Evaluation in an NSCLC Transcriptomic Biomarker Task

智能体系统Agent任务评测Agent Skills

摘要

背景。大型语言模型和人工智能代理越来越多地用于支持生物医学研究,但本机模型输出可能会省略关键分析步骤、误用方法或夸大结论。我们评估了与没有技能的原生人工智能相比,自主访问医学研究技能包是否与人工智能生成的更高质量的转录组研究分析输出相关。方法。我们使用非小细胞肺癌免疫治疗生物标志物任务进行了探索性多模型人体评估。测试了六个模型主干。评估包括 21 个匿名输出:9 个本机 AI 输出和 12 个通过 OpenClaw 代表的 AI 代理实现生成的技能增强输出。四名非专家生物医学评审员和两名盲专家评估了每个输出,每种评审员类型有两个评分。主要结果是专家评价的整体质量。结果。技能增强输出显示出比原生人工智能输出更高的专家整体质量(平均值 5.50 vs 5.11;差异=0.39;bootstrap 95\% CI,-0.04 至 0.90;Welch p=0.156)。非专家审稿人的质量显示出相同的方向(平均值 4.72 vs 4.47;差异=0.26;bootstrap 95\% CI,-0.25 至 0.80;Welch p=0.373)。专家一致意见有限(单级 ICC=-0.15),模型特定效应具有描述性且异质性。结论。自主技能访问在该探索性样本中显示出定向质量信号,但该信号小于专家评级的噪声,不应被解释为确证性证据。这些发现主要激发了对具有更强可靠性控制、平台复制和生物有效性评估的技能增强型人工智能代理进行更大规模的评估。

技能增广AI智能体用于医学研究分析:NSCLC转录组生物标志物任务的探索性多模型人类评估:论文配图
图 1:评估数据集质量控制流程。该图总结了所包含的匿名输出、生成策略分布、人工评分量和非专家评审质量控制检查。