论文

InterPol:通过插值偏好学习对LM Arena去匿名化

InterPol: De-anonymizing LM Arena via Interpolated Preference Learning

模型评测安全与风险评测

摘要

模型响应的严格匿名性是LM Arena等基于投票的排行榜可靠性的关键。尽管已有研究尝试利用TF-IDF或词袋等简单统计特征破坏这一假设,这些方法往往缺乏区分风格相似模型或同家族模型的判别能力。为克服这些局限并揭示漏洞的严重性,我们提出INTERPOL,一个模型驱动的识别框架,利用插值偏好数据学习将目标模型与其他模型区分开来。具体而言,INTERPOL通过模型插值合成困难负样本并采用自适应课程学习策略,捕捉表层统计特征无法发现的深层风格模式。大量实验表明,INTERPOL在识别准确率上显著超越现有基线。此外,我们通过在Arena对战数据上进行排名操纵模拟,量化了这一发现的现实威胁。

InterPol:通过插值偏好学习对LM Arena去匿名化:论文配图
图 1:国际刑警组织概述。 (a) 通过模型插值进行硬负片合成:我们构建了一个插值模型来生成合成硬负片,该模型是通过将经过训练来模仿目标 LLM 的复制模型与其原始主干 LLM 在插值因子 α\alpha 下结合起来构建的。这些与目标响应和从其他模型中选择的最相似的响应一起形成三元组数据来训练检测器模型。 (b) 适应性、迭代课程学习:根据目标和非目标反应之间的差距,国际刑警组织相应地将样本重新分配给不同的任务(双重或三重)。 α\alpha 逐渐增加,这种自适应重新分配和训练在 KK 阶段迭代,导致课程难度逐渐加大。