论文
临床症状检测中自主 Agentic 工作流的优化不稳定性
Optimization Instability in Autonomous Agentic Workflows for Clinical Symptom Detection
摘要
能迭代精炼自身行为的自主 Agentic 工作流前景可观,但其失败模式仍缺乏充分刻画。我们利用自动提示优化开源框架 Pythia 研究“优化不稳定”现象,即持续的自主改进反而使分类器性能退化。在评估三种患病率不同的临床症状(呼吸急促 23%、胸痛 12%、长新冠脑雾 3%)时,我们观察到验证敏感度在迭代间于 1.0 与 0.0 之间震荡,严重程度与类别患病率成反比。在 3% 患病率下,系统达到 95% 准确率却检出零例阳性,这一失败模式被标准评估指标掩盖。我们评估了两种干预:主动引导优化方向的引导智能体反而放大过拟合;回溯识别最佳迭代的选择智能体成功防止了灾难性失败。在选择智能体监督下,系统在脑雾检测上 F1 超过专家整理词表 331%、胸痛超过 7%,而输入只需单个自然语言词。这些发现刻画了自主 AI 系统的一个关键失败模式,并表明在低患病率分类任务中,回溯选择比主动干预更能实现稳定。
