论文

大小、延迟和隐私限制下的设备上商业意图检索:具有类型化出口边界的 3 MiB 检索系统

On-Device Commercial Intent Retrieval Under Size, Latency, and Privacy Constraints: A 3 MiB Retrieval System with Typed Egress Boundaries

摘要

我们研究完全在用户设备上运行的商业意图推断,在工作开始前受到三个限制:下载的有效负载低于 3 MiB,第 0 层推断在 p95 上低于 20 毫秒,并且没有原始文本、内容嵌入或稳定标识符离开设备。在它们之下,我们在 6,020 叶商业分类法上构建了一条检索路径:从韩语句子转换器中提取的静态嵌入表,量化为 4 位,无推理运行时间。我们的主要结果是该约束会影响准确性。在其他人标记的真实韩国商业文本中(22,900 条 AI-Hub 购物评论),真实产品名称的中类前 5 名为 75.0%,而排列基线为 18.4%,但在一个可观察的结果上出现了分裂:包含某些叶子名称作为子字符串的查询得分为 83.5%,不包含叶子名称的查询得分为 45.2%。一个普通的 196.6 倍大的老师似乎可以定位差距(没有锚点+20.1 pp,有锚点+0.1)。这个零值是两个效应抵消:同一位老师对学生自己的对比对进行微调,达到 0.8586,并且在有锚点的情况下比纯编码器学生高出 +10.6 pp,在没有锚点的情况下高出 +20.9 pp。费用并不统一,但也不是任何地方都是免费的;如果锚点不存在,任务适应对老师来说什么也买不到,所以受限编码器缺乏的是容量。这种昂贵的制度可以在设备上从排名者自己的分数差中检测到:降低最不自信的第五名会将其余分数提升到 0.8296。我们首先报告的第二个轴,即制造商型号代码,无法承受源类别固定效应(-4.0 pp,p = 0.51);锚点确实如此(+13.0 pp)。有效负载为 2,942,652 字节,所有三个库链接均已测量。 Tier-0 p95 在两部 iPhone(A14、A16)上为 4.431 和 3.670 毫秒,在廉价 Android 平板电脑(Snapdragon 695)上为 5.080 毫秒,所有这些都比相同代码上的三个服务器 CPU 慢。分类监督主要是合成的韩语话语。