论文
Lightning Weave:通过能力组合提升推理模型的准确率-效率前沿
Lightning Weave: Improving the Accuracy-Efficiency Frontier of Reasoning Models through Capability Composition
摘要
高效推理的核心目标是提升准确率与推理效率的前沿。然而,同时优化准确率和推理效率具有挑战性,因为二者可能偏好不同的推理行为。独立后训练模型已在准确率和效率方面展现出各自优势。我们提出Lightning Weave,一种后训练框架,通过同策略蒸馏提取并组合这些独立学习的能力,以单个学生模型实现能力融合。每项能力由模型在后训练前与后训练后专家模型之间的策略转移表示。Lightning Weave在共享学生词元状态上融合对齐的对数比转移,并利用Tilted-Target DOPD将缓存信号转换为稳定的学习目标。每个锚点对仅对缓存轨迹进行一次评分,从而在无需同时服务多个实时锚点模型的情况下支持后续学生训练。在数学和代码多个学生模型及基准测试中,Lightning Weave显著优于基线模型,达到当前最先进准确率-效率前沿。在Qwen3.5-4B上,其将HMMT 2025准确率从59.2%提升至64.0%,响应词元减少10.7%;将LiveCodeBench v5准确率从41.7%提升至54.2%,响应词元减少9.6%。调整锚点信号的相对强度可获得强实证准确率-效率帕累托前沿。这些结果表明,Lightning Weave是通过能力组合实现高效推理的一种实用新路径。代码已发布于此 https URL。
