论文

公平系统 - 通过约束混合策略 GroupDRO 进行提示选择

Equitable System-Prompt Selection via Constrained Mixed-Strategy GroupDRO

上下文与知识上下文工程

摘要

大语言模型 越来越多地用于信息搜索,但以不同方式表达的语义相同的问题可能会得到质量相当不同的答案。系统提示被广泛用于引导响应行为,但它们通常针对平均情况质量进行优化,因此某些问题短语可能仍会收到不完整或低质量的答案。为了解决这个问题,我们制定了一个用于系统提示选择的约束混合策略 GroupDRO 框架。该框架没有优化系统提示文本,而是为现有池中的系统提示分配权重,以最大限度地减少评估指标和组中最坏情况的信息质量损失,同时限制平均损失以接近基于平均值的选择。由于池生成和选择是解耦的,因此该方法适用于任何系统提示池,并且可以利用一组互补的系统提示而不是单个提示。在两个双语医疗和消费者金融基准的五个 LLM 中,约束方法相对于没有缓解,将总体平均值、最差 25% 平均值和最差平均降低了 13.1%、13.2% 和 13.7%,同时保持整体质量接近平均选择。其多提示权重揭示了度量组对之间的互补性。代码和数据可在 https://github.com/Rainxu09/equitable-system-prompt-selection 获取。