论文
词元效用是以选择为条件的:提示上下文的耦合选择和响应监督以实现高效的指令调整
Token Utility Is Selection-Conditioned: Coupled Selection of Prompt Context and Response Supervision for Efficient Instruction Tuning
摘要
高效的大语言模型 (LLM) 指令调整需要选择具有支持提示上下文的响应监督。现有方法通常分别对双方进行评估,从而存在评估和保留的训练子集之间选择状态不匹配的风险。 BRIDGE(通过定向梯度引导的高效词元选择进行预算响应提示交互)通过共享验证引导的交互代理来捕获选择条件词元效用,该代理在另一方的保留状态下评估每一方。预算交替选择通过聚合当前相反侧子集上的预先计算的交互来协调保留的子集以更新条件分数。结构感知投影将条件响应分数转换为连贯的监督范围。在三个模型系列中,BRIDGE 在数学推理、代码生成和指令跟踪方面全面比较了选择方法。在数学推理中,它相对于独立选择的优势随着压缩而增长。