开源项目OpenSearch-VL:fatal-aware GRPO训练的多模态搜索Agent工程shawn0728/OpenSearch-VLshawn0728·来源日期:2026.05.03模型训练强化学习Agentic RL收藏概述OpenSearch-VL(shawn0728/OpenSearch-VL)是面向多模态搜索Agent的训练工程:以fatal-aware GRPO(在GRPO强化学习中引入致命错误感知)进行训练,并强调全流程可复现。把失败样本显式纳入优化信号的做法,对做搜索类Agent强化学习调优的团队有直接参考价值,方法细节以仓库为准。