论文
CROP:通过正则化提示优化在 大语言模型 中进行词元有效推理
CROP: Token-Efficient Reasoning in Large Language Models via Regularized Prompt Optimization
摘要
大语言模型 利用推理技术提高了任务性能,但由于冗长的生成而导致显着的延迟和词元成本。现有的自动提示优化(APO)框架专门以任务准确性为目标,但以生成长推理轨迹为代价。我们提出了提示成本正则化优化(CROP),这是一种 APO 方法,除了标准精度反馈之外,还通过生成文本反馈来引入响应长度正则化。这迫使优化过程产生提示,引发仅包含关键信息和推理的简洁响应。我们在复杂推理数据集上评估我们的方法,特别是 GSM8K、LogiQA 和 BIG-Bench Hard。我们在保持有竞争力的准确性的同时,实现了词元消耗减少 80.6%,仅看到性能的名义下降。这提供了一种实用的解决方案,用于在生产管道中部署词元高效且经济高效的代理人工智能系统。