论文

联邦近乎免费,推理并不便宜:AI共同科学家在蛋白质表征工作流中的权衡

Federation Is Nearly Free, Reasoning Is Not: Tradeoffs for AI Co-Scientists in Protein Characterization Workflows

智能体系统模型训练强化学习Agent HarnessAgent任务评测Agentic RL

摘要

自然语言驱动的自主共同科学家工作流涉及灵活性与推理之间的根本权衡,其代价是确定性、可复现性和可观测性。这类智能体日益需要跨机构边界通信,而联邦拓扑会影响延迟和成本。我们在一个生产级科学智能体平台上通过受控消融系统评估了这些权衡。我们使用一个可验证的任务:给定一个蛋白质序列,要求智能体通过在常用工具之间路由来自信地表征其功能。我们比较了联邦拓扑、经典RL与LLM驱动的框架、语言模型和提示专业性。我们还按蛋白质新颖性对结果分层。我们发现,LLM的选择对预测质量的影响远大于拓扑或提示(Opus约92%-94%对o4-mini约40%-50%)。PPO策略以零token成本、最快延迟和完全一致性达到与最佳LLM几乎相同的准确率(88%),但不产生推理轨迹。专家提示的LLM达到最高准确率但成本高且一致性较低;任务越难,提示依赖性越大。联邦对性能的惩罚可忽略。这些结果为部署科学工作流智能体提供了可操作指导:对于例行的、可验证的任务,便宜的确定性策略以完全可复现性提供接近前沿的准确率,而灵活的LLM推理最好留给开放式发现。