论文

排名可移植性并不意味着可行性可移植性:联合硬件约束的特定目标评估

Rank Portability Does Not Imply Feasibility Portability: Target-Specific Evaluation of Joint Hardware Constraints

模型评测评测方法与指标

摘要

跨设备硬件评估通常假设,如果架构排名跨设备转移,代理设备可以支持目标端模型选择。我们对这个假设进行了压力测试,以验证两个公共架构系列联合延迟能量的可行性。在 NAS-Bench-201 上,跨设备排名相关性适中,而目标可比可行集重叠仍然不完整。忠实的 AdaProxy 诊断可显着改善延迟排名,表明观察到的边界故障不仅仅是由于适应较弱造成的。精确的有限样本分割保形分析还暴露了一个证据瓶颈:有限的单侧 90% 阈值需要至少九个校准观测值。然后,我们在 13 个 HW-GPT-Bench 设备上的 10,000 个 GPT 架构上复制了该现象。相对于 RTX3080 代理,目标延迟 SRCC 范围为 0.951 至 0.996,但在匹配的联合约束下,代理重用违规风险范围为 33.3% 至 100%。这些结果表明,排名可移植性、可行性可移植性和针对特定目标的决策支持是不同的评估对象。因此,跨设备评估应报告哪些目标环境实际支持所声明的操作点。