论文
分析LLM-求解器循环中的叙述缺口
Analyzing the Narration Gap in LLM-Solver Loops
摘要
当安全或安危攸关问题可被形式化为逻辑时——SAT与SMT求解器等形式化工具日益嵌入语言模型推理管线。不同于步骤从模型分布采样、无形式保证的思维链——求解器产出可靠且可独立验证的答案。但可靠性保证可能在求解器与模型的交互中丢失。混合管线有三个组件:形式化问题、判定它、叙述结果。先前工作研究了形式化与判定——但没有研究叙述——即把形式化工具的输出转为用户答案的步骤。为填补叙述缺口——我们首先把LLM-求解器循环建模为经验证的判定程序。我们进一步在提示注入下评估五个开源模型——发现证书门控使求解器裁决可靠——而攻击者可跨措辞与通道反转一个经验证的结论。我们研究经加固提示的缓解——其显著降低注入但无法消除——且在自适应攻击下仍然受创。结合形式分析与实证研究——我们表明在LLM-求解器循环中——鲁棒性并未抵达用户最终读到的答案。
