论文
PRISM:使用跨度掩蔽进行概率重新分配,以实现知识敏感的对齐
PRISM: Probability Reallocation with In-Span Masking for Knowledge-Sensitive Alignment
摘要
带有 词元级 硬标签的监督 微调 (SFT) 可以放大对事实上不受支持的目标的过度自信模仿,从而导致在多句子生成中传播的幻觉。我们研究了一种增强的 SFT 设置,其中训练实例包括粗略的句子级事实风险标签和句子间依赖注释,提供有关事实承诺支持较弱的结构化信号。我们提出 \textbf{PRISM},一种可微分的风险门控框架,仅在事实关键位置修改学习。 PRISM 通过轻量级、模型感知的概率重新分配目标增强了标准 SFT,该目标惩罚对风险目标词元的高置信度预测,其范围由跨度级别风险权重和模型感知门控控制。对幻觉敏感的事实基准和一般评估的实验表明,PRISM 改善了跨骨干网的事实聚合,同时保持有竞争力的整体能力概况。消融进一步表明,保守使用时辅助信号是最有效的,并且知识屏蔽和模型感知重新分配在平衡事实校正和能力保留方面发挥着补充作用。