产品与服务
AWS Nova Forge:无服务器多轮强化学习正式可用,支持自定义奖励函数
无服务器多轮强化学习正式可用
概述
AWS宣布Nova Forge的无服务器多轮强化学习(multi-turn RL)能力正式可用,向用户交付可执行的多轮RL训练服务。从配套博客看,用户可以为训练定义自定义奖励函数(custom reward functions),让模型在多轮交互过程而不是单轮问答中被优化,训练以无服务器方式运行,无需自建和管理训练集群。这改变了模型定制训练的工作流:以往需要搭建强化学习基础设施的团队,现在可以通过服务化方式提交多轮训练任务。适合需要让模型贴合多步业务流程(如客服、工具调用)的团队;支持的模型范围、可用区域与计费方式未披露。