论文

评测LLM确定性计算的提示与执行方法

Evaluating Prompting and Execution-Based Methods for Deterministic Computation in LLMs

模型评测模型能力评测

摘要

大语言模型(LLM)在自然语言理解与推理上能力强劲,但其执行精确、确定性计算的能力仍不清楚。本文系统评估多种提示策略——思维链(CoT)、Least-to-Most分解、程序思维(PoT)与自洽(SC)——在要求精确无误输出的任务上的表现,包括二进制计数、最长子串检测与算术求值。为支持本研究,我们引入含多样自然语言指令的合成数据集,支持跨任务类型的可控精确计算评估。结果显示:标准提示方法在序列类任务上仅达中等准确率;CoT改进有限,Least-to-Most受误差累积拖累;相比之下,PoT生成可执行代码并把计算委托给外部解释器,达到完美准确率;自洽经多数投票提升鲁棒性但计算开销大。我们进一步训练小领域模型(CodeT5-small)生成可执行程序,以极小训练成本在所有任务的留出测试数据上达到完美准确率。总体而言,发现提示LLM可能是在模拟推理模式而非可靠执行精确符号计算;对确定性任务,LLM结合外部工具或使用专用模型提供更可靠高效的方案。

评测LLM确定性计算的提示与执行方法:论文配图
图 1:混合数据集的标记长度分布。与二进制计数和算术任务相比,最长的子串任务会产生明显更长的输入和目标程序,从而促使选择更大的最大序列长度。