论文

PoQ-Judge:去中心化 LLM 推理中成本感知质量证明的多架构评估框架

PoQ-Judge: A Multi-Architecture Evaluation Framework for Cost-Aware Proof-of-Quality in Decentralized LLM Inference

模型评测评测方法与指标

摘要

去中心化的 LLM 推理网络需要轻量级、无参考的质量评估来进行质量证明 (PoQ)。我们提出了 PoQ-Judge,这是一个训练专用判断模型的框架,可以在没有 真值 引用的情况下对查询输出对进行评分。我们研究了三种跨越质量成本权衡的架构:TextCNN 判断器、MiniLM 交叉编码器和 DeBERTa 判断器。使用 UltraFeedback 加上 GPT 标记的域内数据的两阶段训练,最佳模型在保留测试集上与 真值 代理的 Pearson 相关性达到 0.747,优于先前工作中基于参考的评估器。作为综合评分中的无参考组件,它实现了 0.645 的皮尔逊相关性,匹配最佳的单一基于参考的评估器,同时消除了对参考答案的需要。我们还表明,在线校准将语义质量确定为主要维度,并且级联评估将成本降低了 72.7%,而质量损失却很小。质量保证的结果比总结的结果要强得多,这表明代理质量是主要的剩余限制。