论文
大语言模型 的拓扑增强对齐:轨迹拓扑损失和拓扑偏好优化
Topology-Enhanced Alignment for Large Language Models: Trajectory Topology Loss and Topological Preference Optimization
摘要
通过 SFT 和 RLHF/DPO 对齐 大语言模型 (LLM) 通常会忽略表示空间的全局几何形状,而是依赖于局部标记似然或标量分数。我们将生成视为追踪隐藏空间中的语义轨迹,并提出了一种拓扑增强的对齐框架,该框架使用 0 维持久同源性来规范这些轨迹。首先,对于 SFT,我们引入轨迹拓扑损失(TTL)。将提示和黄金答案嵌入视为混合点云,我们使用 0D 持久同源算法来提取“提示答案桥”。 TTL 将模型的实际更新方向与这些拓扑桥对齐,而不是任意方向。其次,对于DPO,我们提出拓扑偏好优化(TPO)。 TPO 构建特定于主题的语义偏好向量,并在中间隐藏层中将拒绝和选择的响应之间的改进方向与这些向量对齐。我们还引入了动态加权方案来平衡 DPO 和 TPO 损失。使用 UltraChat 和 Anthropic HH-RLHF 对 Qwen2.5-7B-Instruct 进行评估,我们的拓扑增强目标在自动偏好指标和 LLM 判断评估方面始终优于强大的非拓扑基线(例如,每个示例、最近邻、随机正则化器),同时保持或改善毒性。结果表明,持久的同源性和轨迹几何形状为可控对准提供了有希望的方向。