论文
学习临床试验策略:决策Agent的离线策略训练
Learning Clinical-Trial Strategy: Offline Policy Training for Decision Agents
摘要
临床开发是一个在不确定性下进行的顺序决策过程,其中发起人必须从不同来源的证据中规划一个药物项目的试验组合。我们通过将肿瘤学临床开发问题视为离线决策问题来研究这一设置,该问题中的代理根据在决策日期可获得的信息预测肿瘤药物项目的下一个六个月试验组合。为了支持这一点,我们构建了一个包含31.7k个不同来源的公共数据记录的数据集,包括试验登记处、监管审查、发起人提交、使用数据和流行病学信息,这些数据被整合成45个历史项目的881个离线决策阶段。我们比较了四种离线目标:行为克隆、奖励加权的行为克隆、学习奖励训练和基于价值的隐式Q-学习与四个前沿的LLM代理进行比较,这些代理共享一个共同的时间门控检索支架,在未公开的药物、发起人、药物类别和时间分组上。在离线训练模型中,结果优于未经微调的基础基准,特别是在2025年8月之后的污染-清洁保留集上表现最佳。奖励加权的行为克隆性能最好,相对于25.0%和2.1%的最佳工具代理,分别获得了46.2%的指示F1和14.2%的严格F1。这些结果表明,结构化的离线学习可以教代理规划临床试验。