论文
HARISSA:推理时自检以实现高效、安全的本地语言模型部署
HARISSA: Inference-Time Self-Checks for Efficient and Safe Local Language Model Deployment
摘要
在本地运行语言模型在隐私、延迟和成本方面具有优势,但本地硬件仅适合小型模型,这些模型的能力不如前沿模型。硬查询的通常补救措施是将其升级到云模型,但放弃了本地运行的隐私和成本优势。相反,保留本地的部署面临两个硬查询决策。首先,它可以在查询上花费更多的计算,例如,在回答之前进行推理,这会以延迟为代价提高准确性,因此它必须决定哪些查询值得额外的计算(效率)。其次,某些查询超出了本地模型,并且提供错误的答案比将查询推迟给循环中的人员更糟糕,因此它必须决定哪些答案可以安全地提供(安全)。我们证明这两个决策都可以根据模型自身的隐藏状态做出。预填充状态在生成任何标记之前计算,预测模型是否会正确回答,而答案状态在生成的答案末尾预测该答案是否正确。 HARISSA 对模型进行微调,以便两个状态都预测正确性,然后使用一种策略做出这两个决策,该策略通过从最便宜到最昂贵的回答方式进行级联,跳过预填充状态预测将失败的方式,并在停止的答案被预测为错误时推迟查询。在运行单一模型的设备上,HARISSA 在思想链的一个准确点内,延迟降低了 2.7 倍。在持有一种模型的四种尺寸的服务器上,HARISSA 在相同的延迟下比 FrugalGPT 和 Self-REF 级联更准确,并且在相同的延迟率下,答案状态在六个任务和设置对中的五个中留下的错误答案比标准置信度信号要少。