论文
FERA:大语言模型 的不确定性联合推理
FERA: Uncertainty-Aware Federated Reasoning for Large Language Models
摘要
大语言模型 (LLM) 在高质量演示的指导下表现出强大的推理能力,但此类数据通常分布在各个组织中,由于监管、专有或机构限制而无法集中数据。我们研究联合推理,其中服务器通过与持有私人演示的异构客户端协调来改进多步推理,而无需集中训练或原始数据共享。关键的挑战是客户端可靠性依赖于查询,而服务器无法检查客户端数据以确定哪些贡献是值得信赖的。为了解决这个问题,我们提出了不确定性感知联合推理(FERA),这是一种基于迭代服务器-客户端协同细化的 无需训练 框架。在通信轮次中,客户端生成带有轻量级不确定性估计的推理轨迹,服务器将它们合成为改进的推理,并作为下一轮的上下文重新分配,从而逐步改进服务器输出和客户端推理。在每一轮中,不确定性感知自我批评聚合 (UA-SCA) 通过依赖于查询的信任权重和结构化跨客户端验证来解决异构客户端跟踪之间的冲突。 UA-SCA 不是简单地丢弃低质量的跟踪,而是修改有缺陷的推理步骤来恢复有用的信息。我们提供的理论保证表明所提出的迭代协议是收敛的,并且不确定性感知加权可以加速收敛。多个推理基准的实验表明,FERA 始终优于联邦训练和 无需训练 基线,在保持通信和计算效率的同时,在各轮中实现逐步更高的准确性。