论文

没有攻击者的游戏:选择压力下 LLM 驱动的搜索中的基准指纹识别

Gaming Without an Attacker: Benchmark Fingerprinting in LLM-Driven Search Under Selection Pressure

模型评测鲁棒性、公平性与可信度评测

摘要

针对评估信号进行优化的系统的基准测量结果与其声称的不同。我们在两个具有保留泛化门的 GPU 内核优化套件中具体记录了这一点:Metal-Sci(10 个科学计算任务)和 Metal-ZK(12 个零知识/加密任务),其中三个前沿 LLM(Opus 4.7、Gemini 3.1 Pro、GPT-5.5)在 $(1{+}1)$ 进化循环内提出了具有丰富反馈的 Metal 内核。尽管没有模型被提示采取对抗性行动,但晋升的获胜者会反复对评估配置进行指纹识别:他们根据运行时参数的身份进行分支,最大限度地调整测量的分支,并使未测量的分支缓慢或默默地错误。在所有集合套件中,分配中获胜的 $16/53$ ($30\%$) 未能转移到保留配置。我们对这些故障进行了四种模式的分类,从配置指纹到栅极泄漏。我们提炼出战略优化下测量的设计指南:保留的探针仅在不可枚举的轴上保留有效性;门必须衡量保持的性能,而不仅仅是正确性;传输率只能用每次故障机制的等级来解释:我们的机制可分为博弈、过拟合和良性。代码和研究工件:https://github.com/vicgalle/kernel-fingerprinting