论文
大语言模型 的风险条件 微调
Risk-Conditioned Fine-Tuning of Large Language Models
摘要
大语言模型 (LLM) 越来越多地部署在罕见但严重的有害世代可能产生严重后果的环境中。现有的风险规避 RLHF 通过优化条件风险价值 (CVaR) 来解决这个问题,但它针对固定风险水平训练策略,因此无法在推理时调整所需的风险规避程度。在本文中,我们提出了风险条件 RLHF,这是一个训练单个策略的框架,该策略提供连续的风险控制接口,使用户能够选择不同程度的风险规避,而无需重新训练或部署多个特定风险模型。跨多个基准的实验表明,单个风险条件策略可以在推理时适应不同的风险级别,从而实现更灵活和具有风险意识的 LLM 部署。