论文
Box Maze:面向可靠LLM推理的过程控制架构
Box Maze: A Process-Control Architecture for Reliable LLM Reasoning
摘要
大语言模型(LLM)展现出强大的生成能力,但在对抗性提示下仍易出现幻觉与不可靠推理。现有安全方法——如基于人类反馈的强化学习(RLHF)与输出过滤——主要在行为层面发挥作用,可能缺乏强制推理过程完整性的显式架构机制。本文提出Box Maze框架,一种概念性的过程控制架构,将LLM推理分解为三个显式层次:记忆锚定、结构化推理与边界执行。我们引入初步的基于仿真的评估,涉及跨多个异构LLM系统(DeepSeek-V3、Doubao、Qwen)的渐进式边界侵蚀场景。来自n=50个对抗场景的结果表明,显式认知控制层可提升边界维护的一致性,架构约束在对抗条件下将边界失败率从约40%(RLHF基线)降至1%以下。尽管当前验证基于仿真,这些初步结果表明过程级控制可为提升大语言模型推理的可靠性提供一个有前景的方向。