论文

缩小社会语义差距:用于云中基于边缘的提示压缩的 SPSD LLM 推理

Closing the Social-Semantic Gap: SPSD for Edge-Based Prompt Compression in Cloud LLM Inference

上下文与知识上下文工程

摘要

大语言模型 (LLM) 推理的预填充阶段对云规模能源成本的影响越来越大。许多消费者支持和对话提示都包含社交脚手架:礼貌标记、道歉序言、重复和建立融洽关系的语言,这些语言对人类交流很重要,但对机器推理来说边缘信息很少。我们将这种差异称为社会语义差距。我们提出了 SPSD(情感保留语义 蒸馏),这是一种基于边缘的管道,它在传输到云部署的 LLM 之前使用 4 位量化小语言模型压缩用户提示。使用 Gemma-2-2B-Instruct (Q4_K_M) 作为 SLM 和 Llama-3.1-8B-Instruct 作为云评估模型对 248 个提示语料库进行评估,每个精炼调用的平均输入词元节省为 99.9 个词元,所有 146 个精炼调用都产生了正节省。通过 LLM 作为评委对 121 对进行盲打评分来评估的响应质量,在 15 分评分标准上预先指定的 1 分差内不劣于原始路径;法官判定 43% 为平局,28% 为蒸馏胜利,29% 为原始胜利。余弦相似度是混合的:均值 0.682,中值 0.712,其中 54.1% 的对高于 0.70 参考阈值。安全关键域通过基于规则的门保守地路由至直通。根据规定的假设,每次通话净节能预计为 70-270 uWh。 SPSD 显示,设备上提示 蒸馏 可以降低云 LLM 输入词元成本,同时在实际的非劣效性范围内保持响应质量。