论文

JudgeStealer:跨评估协议提取 LLM 判断能力

JudgeStealer: Extracting LLM Judging Capabilities across Evaluation Protocols

摘要

大语言模型(LLM)法官越来越多地应用于各种评估场景,使他们的判断能力成为宝贵的知识产权。然而,黑盒访问将这些功能暴露给模型提取攻击。现有的提取方法并不专门针对 LLM 法官,并且在有限的查询预算下为多种评估协议提供有限的支持。在本研究中,我们提出了 JUDGESTAALER,这是第一个查询高效的模型提取框架,用于跨点评分、成对比较和列表排序协议复制判断功能。 JUDGETEALER 利用强大的跨协议协议来获取点分数并将其转换为成对和列表监督,而无需额外的受害者查询。为了捕获信息丰富的判断模式并提高查询效率,JUDGESTEALER 根据语义多样性、预测不确定性和潜在的判断偏差动态选择逐点输入。它进一步应用分数平滑和多协议审查来保留分数的顺序结构并减轻代理适应期间的灾难性遗忘。对最先进的 LLM 作为法官和奖励模型的大量实验表明,JUDGETEALER 始终优于现有的提取基线,在逐点、成对和列表评估方面分别实现高达 73.3%、87.0% 和 71.6% 的准确率。 JUDGETEALER 在不同的代理模型尺度、适应策略和推理设置中也仍然有效。此外,JUDGETEALER 表现出了针对代表性提取防御的鲁棒性。