论文
SEPAL:分离的专家对与答案级融合,实现可靠的 LLM 协作
SEPAL: Separated Expert Pairs with Answer-Level Fusion for Reliable LLM Collaboration
摘要
多Agent协作让大语言模型 (LLM) 通过审议和反馈改进问题回答。然而,共同的讨论伴随着纠正和暴露相同的错误,这可能会削弱投票所需的多样性。自我一致性在没有反馈的情况下提供了采样多样性,而单对 Actor-Critic 协作仅改进了一个候选者。我们引入了 SEPAL,它指派三个私人 Actor-Critic 团队进行直接推理、证据基础和验证。针对特定角色的训练为团队提供了抽样变异之外的不同推理目标。每个批评家都会在自己的团队内指导修订,防止反馈在候选人之间带来错误。修订结束后,多数投票仅合并最终答案,在做出决定之前将推理历史分开。在五个开放权重主干网和五个问答基准中,SEPAL 比匹配的单个 Actor-Critic 对平均准确度提高了 1.81 个百分点,并且所有五个主干网都有所改进。代码可在 https://github.com/zhansan114514/SEPAL. 获取