论文

面向长程生物信息学工作流的过程奖励战术演化

Process-Reward Tactic Evolution for Long-Horizon Bioinformatics Workflows

模型训练上下文与知识奖励建模与过程监督记忆Agent记忆

摘要

LLM智能体能写代码、调工具——但可靠的生物信息学工作需要与工作流软件、带类型数据对象、来源记录与生物学检查的长程交互。我们经Galaxy工作流执行研究该设定。智能体必须探索任务数据、构造或适配可执行工作流DAG、绑定输入与数据集集合、监控执行、调试失败——并验证生物学输出。我们提出过程奖励战术演化——基于Galaxy的训练框架——把经验证的工作流rollout转为可复用战术。训练期间——智能体在Agent Gym的课程化Galaxy任务上练习;过程验证器为工作流构建、软件交互、执行与生物学正确性打分;成功与失败踪迹被蒸馏进战术库。推理时——训练出的执行器过程奖励战术演化——使用该库在隔离环境中执行留出的同行评审Galaxy工作流转换的BioWorkflow Bench与BioAgent Bench任务。论文评估过程监督的战术积累是否较无记忆与反思式基线改进长程生物信息学工作流完成、生物学正确性与执行效率。

面向长程生物信息学工作流的过程奖励战术演化:论文配图
图 1:过程奖励策略演变概述。培训执行按课程组织的 Galaxy 部署,通过过程奖励对其进行评分,并更新外部策略状态。 Inference 为执行保留的 Galaxy 工作流任务的孤立工作人员检索训练有素的策略库。