论文

SafeCtrl-RL:通过 RL 驱动的提示优化实现 LLM 对话的推理时间自适应行为控制

SafeCtrl-RL: Inference-Time Adaptive Behaviour Control for LLM Dialogue via RL-Driven Prompt Optimisation

上下文与知识上下文工程

摘要

确保 大语言模型 (LLM) 中的安全和上下文适当的行为仍然是实际部署的关键挑战。我们提出了 \textbf{SafeCtrl-RL},一种推理时行为控制框架,无需模型重新训练或参数修改即可实现自适应安全调节。该方法将对话生成表示为一个顺序决策过程,其中强化学习代理根据上下文反馈动态选择即时调整策略。这允许通过迭代细化来抑制不安全行为,我们将其概念化为推理时行为忘却。经过多个 LLM 和不安全对话场景的评估,SafeCtrl-RL 持续提高安全性和响应质量,优于现有的基于提示的优化方法,并实现了良好的性能-效率权衡。 **警告:本文可能包含有害语言的示例,建议读者谨慎阅读。