论文

SpecAlign:经合成数据实现规格锚定的LLM高效对齐

SpecAlign: Efficient Specification-Grounded Alignment of Large Language Models via Synthetic Data

模型训练合成数据

摘要

随着大语言模型(LLM)日益部署于真实应用——对齐不再由单一普适的安全或有用性概念治理——而由提供商或应用特定的模型规格治理。这些规格通常长、结构化且频繁更新——但既有对齐管线缺乏把它们操作化为训练信号的系统机制。本文提出规格锚定对齐——新对齐范式——把提供商撰写的模型规格当作首要对齐目标——而非抽象原则或静态基准。为实例化该范式——我们介绍SpecAlign——直接从规格文档合成对齐数据的框架。SpecAlign组合结构化规则标注、可控规格实例化与多智能体对抗数据合成——生成细粒度、边界感知的偏好对——同时捕捉合规行为与有意义的规格违例。跨多个模型规格与骨干模型的实验表明:用SpecAlign训练持续改进规则遵循——同时保持通用能力、避免过度保守行为。这些结果表明把对齐锚定于显式模型规格——能使LLM行为对演化政策需求的适配快速、精确、可扩展。

SpecAlign:经合成数据实现规格接地的LLM高效对齐:论文配图
图 1:该示例演示了模型规范如何定义语言模型输出的对齐方式。