论文
小语言模型帮助解决LLM提示符的语义歧义
Small Language Model Helps Resolve Semantic Ambiguity of LLM Prompt
摘要
大语言模型(LLM)由于其出色的指令跟踪能力,越来越多地应用于各种复杂的推理任务。然而,该模型的性能高度依赖于用户输入提示的开放式特征。自然提示通常不遵循正确的语法规则,这会产生含糊不清的查询,从而产生多种解释。这种模棱两可的提示会使模型在选择正确的推理路径来回答问题时感到困惑。先前的工作通过在 LLM 推理过程中应用查询编辑来解决这一挑战,而没有明确解决歧义的根本原因。为了解决这个限制,我们提出了一种通过显式提示消歧的预推理提示优化机制。特别是,我们识别提示中的语义风险,检查其多视角一致性,并解决出现的任何语义冲突。最后,我们以逻辑结构的方式组织已解决的歧义,作为 LLM 的干净输入。通过明确解决语义歧义,我们的方法可以对语义上重要的标记产生更集中的注意力分布。我们还利用小语言模型(SLM)作为提示消歧的主要执行者,以从其高效计算中受益。通过对多个基准的综合实验,我们证明我们的方法以仅 0.02 美元的成本将推理性能提高了 2.5 个点。我们的研究提倡显式提示消歧作为一种有效的提示优化方法,而不干扰 LLM 推理的内部机制。