论文

提示架构决定推理质量:洗车问题上的变量隔离研究

Prompt Architecture Determines Reasoning Quality: A Variable Isolation Study on the Car Wash Problem

模型评测模型能力评测

摘要

大语言模型始终无法解决“洗车问题”——一个需要隐式物理约束推理的流行推理基准。我们呈现一项变量隔离研究(每种条件 n=20,共 6 种条件,120 次试验),考察生产系统中哪些提示架构层能实现正确推理。使用 Claude 3.5 Sonnet 并控制超参数(temperature 0.7、top_p 1.0),我们发现仅 STAR(Situation-Task-Action-Result)推理框架就能将准确率从 0% 提升至 85%(p=0.001,Fisher 精确检验,比值比 13.22)。通过向量数据库检索加入用户画像上下文可再提升 10 个百分点,而 RAG 上下文额外贡献 5 个百分点,使全栈条件下达到 100% 准确率。这些结果表明,结构化推理支架——尤其是推理前的强制目标表述——对隐式约束推理任务的作用远大于上下文注入。