开源项目

OpenSearch-VL:fatal-aware GRPO训练的多模态搜索Agent工程

shawn0728/OpenSearch-VL

模型训练强化学习Agentic RL

概述

OpenSearch-VL(shawn0728/OpenSearch-VL)是面向多模态搜索Agent的训练工程:以fatal-aware GRPO(在GRPO强化学习中引入致命错误感知)进行训练,并强调全流程可复现。把失败样本显式纳入优化信号的做法,对做搜索类Agent强化学习调优的团队有直接参考价值,方法细节以仓库为准。