论文

设计用于便携式查询生成的奖励信号:工业语义求职案例研究

Designing Reward Signals for Portable Query Generation: A Case Study in Industrial Semantic Job Search

模型训练奖励建模与过程监督

摘要

求职平台依赖于低带宽查询接口,这些接口通常无法捕获候选人资料的高维复杂性。我们提出了一个端到端的 RLAIF(人工智能反馈强化学习)框架,用于生成可移植的职位搜索查询,这些术语可以抽象出求职者特定的标识符,同时保留通用的资格。该任务引入了高度对抗性的奖励表面,其中策略优化经常利用 LLM 作为法官规则中的缺陷,导致退化的逐字复制行为。我们进行了全面的实证实验,以隔离优化机制对结构化奖励工程的影响。我们的结果表明,对于无需价值模型的优化器来说,性能绝大多数取决于强大的奖励塑造,使得算法的具体选择在很大程度上无关紧要。虽然无需价值模型的的每条采样轨迹基线方法(RLOO 和 REINFORCE++)本身就抵制 奖励作弊,但 GRPO 中的群体相对优势标准化似乎对虚假​​奖励信号特别敏感,使其特别容易受到利用。我们表明,引入确定性的、基于规则的奖励下限来纠正分配给逐字复制的奖励可以减轻这种失败模式,从而使跨家庭评估法官的质量大幅提高 +0.147。最终,我们表明训练时间奖励模型将性能提升增加了 2.4 倍,证实训练的成功从根本上取决于执行奖励塑造规则,而不是选择替代优化器。