论文
Quark Medical Alignment:整体式多维对齐与协同优化范式
Quark Medical Alignment: A Holistic Multi-Dimensional Alignment and Collaborative Optimization Paradigm
摘要
尽管近年来面向大语言模型对齐的强化学习进展迅速,将这些范式迁移到高风险医疗问答中却暴露出根本的范式失配。基于人类反馈的强化学习(RLHF)依赖偏好标注,其成本高得令人却步,且往往无法反映医学事实的绝对正确性;基于可验证奖励的强化学习(RLVR)缺乏有效的自动验证器,难以应对复杂的临床语境。与此同时,医疗对齐要求同时优化正确性、安全性与合规性,而多目标异构奖励信号容易出现尺度失配与优化冲突。为应对这些挑战,我们提出一种稳健的医疗对齐范式。我们首先构建一个整体式多维医疗对齐矩阵,将对齐目标分解为四类:基础能力、专家知识、在线反馈与格式规范。在每个类别内,我们建立这样一个闭环:可观测的指标支撑可归因的诊断,进而驱动可优化的奖励,从而为后续迭代优化提供细粒度、高分辨率的监督信号。为解决异构信号导致的梯度支配与优化不稳定问题,我们进一步提出一个统一优化机制。该机制采用参考冻结归一化(Reference-Frozen Normalization)来对齐奖励尺度,并实施三因子自适应动态加权(Tri-Factor Adaptive Dynamic Weighting)策略,实现面向短板、风险优先、削减冗余的协同优化。实验结果证明了所提范式在真实医疗场景评估中的有效性,为垂直领域的复杂对齐确立了一种新范式。
