论文

用于通用搜索代理的跨域混合 OPD

Cross-Domain Hybrid OPD for Generalizable Search Agents

摘要

强化学习 (RL) 的最新进展极大地提高了自主搜索代理的能力,实现了复杂的规划和对动态信息源的迭代检索。然而,针对专门搜索行为优化语言模型通常会产生对齐税,搜索性能的提高是以牺牲通用功能为代价的,从而限制了它们作为通用助手的有效性。在这份技术报告中,我们介绍了元宝搜索代理背后的训练框架,旨在在不牺牲通用智能的情况下实现搜索专业化。我们的框架建立在Hunyuan3架构之上,将用于自主搜索的代理强化学习与跨领域专家同策略 蒸馏(OPD)管道相结合。专门从事互补通用领域的专家被提炼为搜索专业的学生,​​恢复并进一步增强其广泛的能力。我们的混合训练策略不是将专业化和通用能力视为相互竞争的目标,而是共同优化两者,从而有效地减轻调整税。大量实验表明,所得模型实现了有竞争力的搜索性能,同时不断提高其通用功能,在现实搜索场景中的专业执行和广泛泛化之间提供了良好的平衡。