论文

提示复杂度稀释结构化推理:关于洗车问题的后续研究

Prompt Complexity Dilutes Structured Reasoning: A Follow-Up Study on the Car Wash Problem

模型评测模型行为与机制分析

摘要

在先前研究[Jo, 2026]中,STAR推理(Situation、Task、Action、Result)将洗车问题在Claude Sonnet 4.5上的准确率从0%提升到85%,加上额外提示层后达到100%。本后续研究问:STAR在生产系统提示中是否保持其有效性?我们在InterviewMate的60多行生产提示内测试STAR,该提示经迭代添加风格指南、格式指令和画像特征演化而来。在Claude Sonnet 4.6上设三条件、各20次试验:(A)带Anthropic画像的生产提示,(B)带默认画像的生产提示,(C)原始STAR-only提示。C得分100%(n=100验证)。A和B分别得分0%和30%。提示复杂度稀释结构化推理。STAR单独使用时达100%,但被竞争性指令包围时降至0-30%。机制:像"以具体细节开头"这样的指令强制结论先行的输出,颠倒了使STAR有效的先推理后结论的顺序。在一个案例中,模型先输出"简答:步行。"然后执行正确识别出约束的STAR推理——证明模型能够正确推理,却已承诺了错误答案。跨模型比较显示,STAR-only在提示不变的情况下从85%(Sonnet 4.5)提升到100%(Sonnet 4.6),表明模型升级会放大结构化推理在孤立测试中的表现。这些结果意味着,不应假设结构化推理框架能从孤立测试迁移到复杂提示环境。模型推理与下结论的顺序是一等设计变量。