论文
InterPol:通过插值偏好学习对LM Arena去匿名化
InterPol: De-anonymizing LM Arena via Interpolated Preference Learning
摘要
模型响应的严格匿名性是LM Arena等基于投票的排行榜可靠性的关键。尽管已有研究尝试利用TF-IDF或词袋等简单统计特征破坏这一假设,这些方法往往缺乏区分风格相似模型或同家族模型的判别能力。为克服这些局限并揭示漏洞的严重性,我们提出INTERPOL,一个模型驱动的识别框架,利用插值偏好数据学习将目标模型与其他模型区分开来。具体而言,INTERPOL通过模型插值合成困难负样本并采用自适应课程学习策略,捕捉表层统计特征无法发现的深层风格模式。大量实验表明,INTERPOL在识别准确率上显著超越现有基线。此外,我们通过在Arena对战数据上进行排名操纵模拟,量化了这一发现的现实威胁。
