论文
SafeRun:在 LLM 运行规划中启用确定性
SafeRun: Enabling Determinism in LLM Planning for Running
摘要
大语言模型 支持灵活的自然语言规划,但由于其概率性质,在确定性关键领域仍然不可靠。这种限制在运行规划中尤其成问题,违反安全规则可能会导致安全风险。我们提出了 SafeRun,这是一个通过解耦架构进行基于 LLM 的确定性规划的框架。 SafeRun 将 LLM 的软解释与确定性求解器的硬约束执行分开,确保严格的安全约束,同时保留自然语言的灵活性。为了验证 SafeRun,我们建立了一个全面的基准,用于在现实的生理和安全约束下进行跑步计划。五个 LLM 的实验表明,SafeRun 实现了 100% 的安全得分(相对于 PE 平均值 79.1% 和 CodeAct 平均值 97.6%),同时保持了有竞争力的指令遵循分数。 SafeRun 基准测试可在 \href{https://huggingface.co/datasets/zzp-seeker/SafeRun-RunPlanning-Benchmark}{huggingface} 上公开获取。