论文

最后一层模型窃取的几何结构

The Geometry of Last-Layer Model Stealing

模型评测安全与风险评测

摘要

本文使用几何学来解释如何使用现有的众所周知的方法来窃取机器学习模型。作者展示了完美复制 Transformer 网络最后一层所需的确切条件。当深入研究隐藏层时,作者解释了明确的限制。作者还证明,仅通过查看最终结果无法对隐藏网络进行完全逆向工程。该研究清楚地指出了模型中哪些内容可以被窃取,哪些内容不能被窃取。