论文

临床症状检测中自主 Agentic 工作流的优化不稳定性

Optimization Instability in Autonomous Agentic Workflows for Clinical Symptom Detection

智能体系统Agent任务评测智能体自我改进

摘要

能迭代精炼自身行为的自主 Agentic 工作流前景可观,但其失败模式仍缺乏充分刻画。我们利用自动提示优化开源框架 Pythia 研究“优化不稳定”现象,即持续的自主改进反而使分类器性能退化。在评估三种患病率不同的临床症状(呼吸急促 23%、胸痛 12%、长新冠脑雾 3%)时,我们观察到验证敏感度在迭代间于 1.0 与 0.0 之间震荡,严重程度与类别患病率成反比。在 3% 患病率下,系统达到 95% 准确率却检出零例阳性,这一失败模式被标准评估指标掩盖。我们评估了两种干预:主动引导优化方向的引导智能体反而放大过拟合;回溯识别最佳迭代的选择智能体成功防止了灾难性失败。在选择智能体监督下,系统在脑雾检测上 F1 超过专家整理词表 331%、胸痛超过 7%,而输入只需单个自然语言词。这些发现刻画了自主 AI 系统的一个关键失败模式,并表明在低患病率分类任务中,回溯选择比主动干预更能实现稳定。

临床症状检测中自主 Agentic 工作流的优化不稳定性
图1:Pythia多智能体架构。优化循环从临床笔记和传给Specialist Agent的提示P_t开始,该智能体产出二分类结果ŷ∈{0,1}。系统计算灵敏度(σ_t)、特异度(τ_t)和F1分数。若满足收敛准则,系统输出最终提示P*;否则,Error Analysis Agent(橙色)为假阴性(FN)或假阳性(FP)生成自然语言批评,由Synthesis Agent(绿色)将其聚合为精炼后的提示P_{t+1}。循环迭代直至收敛或达到最大迭代次数。