论文

PP-ProPS:隐藏策略参数的 LLM 提示式控制搜索

Privacy-Preserving Prompted Policy Search for Robotic Control

AI 基础设施智能体系统Agent 规划AI安全与内容治理基础设施

摘要

大型语言模型 (LLM) 最近展示了作为强化学习 (RL) 上下文策略优化器的前景广阔的功能,可实现由数字奖励信号和自然语言推理驱动的策略搜索。然而,在实践中部署此类方法需要将原始策略参数和奖励历史传输到基于云的 LLM API,从而向第三方服务提供商公开专有的控制策略。为了解决这个问题,本文介绍了隐私保护提示策略搜索(PP-ProPS),这是一个框架,可以实现大语言模型指导的策略优化,同时对策略和环境参数进行保密处理。 PP-ProPS 在将策略参数和奖励值包含在每个 API 请求中之前,使用秘密客户端转换对其进行编码,确保 LLM 提供者仅观察编码的策略参数和缩放的奖励信息。此外,与 Vanilla ProPS 不同,所提出的框架不需要向大语言模型了解或披露真正的最佳情景回报。除了保护优化数据之外,PP-ProPS 还通过两种方式改进搜索过程。首先,它为大语言模型提供单独的奖励组成部分,而不仅仅是单一的总回报,从而提供有关每个候选策略的更多信息反馈。其次,它使用有界历史来防止提示无限增长,通过高维策略改进搜索并支持开放权重大语言模型的使用。所提出的 PP-ProPS 针对连续和离散控制问题进行了评估,涵盖接触式多关节动力学 (MuJoCo) 运动、经典控制、高速公路驾驶和机械臂操纵。与 Vanilla ProPS 相比,所提出的 PP-ProPS 在 10 个评估任务中的 7 个中优于 ProPS,并在 6 个任务中的 5 个中超过了包括 PPO、SAC 和 TRPO 在内的传统 RL 方法。

PP-ProPS让云端LLM搜索编码参数,解码、执行和秘密变量保存在可信客户端。
图1(图注摘要):PP-ProPS让云端LLM搜索编码参数,解码、执行和秘密变量保存在可信客户端。