论文

POaaS:以最小编辑的提示优化即服务提升端侧sLLM准确率并减少幻觉

POaaS: Minimal-Edit Prompt Optimization as a Service to Lift Accuracy and Cut Hallucinations on On-Device sLLMs

上下文与知识上下文工程

摘要

小语言模型(sLLM)越来越多地部署在设备端,而在这种场景下,不完善的用户提示——拼写错误、意图不清或缺少上下文——可能引发事实错误和幻觉。现有的自动提示优化(APO)方法是为大型云端LLM设计的,依赖搜索且往往生成长而结构化的指令;当在端侧约束下执行——即同一个小模型必须既充当优化器又充当求解器——这些流水线会浪费上下文,甚至损害准确率。我们提出POaaS,一个最小编辑的提示优化层,它将每个查询路由到轻量专家(Cleaner、Paraphraser、Fact-Adder),并在严格的漂移与长度约束下合并其输出,同时对格式良好的提示采取保守的跳过策略。在使用Llama-3.2-3B-Instruct与Llama-3.1-8B-Instruct的严格固定模型设置下,POaaS同时提升了任务准确率与事实性,而具有代表性的APO基线则使二者下降;在token删除与mixup扰动下,POaaS最多可挽回+7.4%。总体而言,对于端侧sLLM,逐查询的保守优化是重搜索APO的一种实用替代方案。

POaaS:以最小编辑的提示优化即服务提升端侧sLLM准确率并减少幻觉:论文配图
图1:POaaS:提示经启发式路由至Cleaner、Paraphraser、Fact-Adder专家,由Merger受控合并为优化提示。