论文

通过证据校准的查询聚类捕捉LLM能力

Capturing LLM Capabilities via Evidence-Calibrated Query Clustering

模型评测评测方法与指标

摘要

查询聚类将查询组织成反映共享潜在能力需求的组,从而实现能力感知的LLM评估。现有聚类方法主要依赖语义分类体系或嵌入表示,由于表层语义与实际模型表现之间的错位,往往无法捕捉这类潜在能力需求。我们提出ECC,一种利用有限的后验模型比较来校准先验语义嵌入的算法,以弥合表层语义与潜在能力需求之间的鸿沟。ECC通过由Bradley-Terry模型参数化的能力画像来刻画每个聚类,并使用可训练的混合权重来适应具有混合能力需求的查询,从而联合学习出一个灵活的、能力感知的聚类结构,支持针对具体查询的LLM能力推断。大量定量与定性评估表明,ECC显著提升了LLM能力排序质量,分别以平均17.64和18.02个百分点的优势超越人工标注基线和基于嵌入的基线,并在查询路由等下游任务中证明有效。

通过证据校准的查询聚类捕捉LLM能力:论文配图
图 5:在 K=20K=20 时由三种不同聚类方法得出的硬分区的聚类重叠矩阵。每个单元格显示一对集群共享的查询数量。 ARI (↑\uparrow) 和 NMI (↑\uparrow) 量化两个聚类之间的总体一致性。