论文

迈向可关停智能体:RL智能体与LLM中随机性选择的泛化

Towards Shutdownable Agents: Generalizing Stochastic Choice in RL Agents and LLMs

模型训练强化学习

摘要

未对准的人工代理可能会抵制关闭。一种提出的解决方案是训练代理在不同长度的轨迹之间缺乏偏好。同长轨迹折扣奖励 (DReST) 奖励函数通过惩罚重复选择相同长度轨迹的智能体来实现此目的,从而激励智能体 (1) 在不同轨迹长度之间随机选择(对轨迹长度保持中性),以及 (2) 有效地追求以每个轨迹长度为条件的目标(有用)。在本文中,我们使用 DReST 来训练深度 RL 代理,并将 LLM 微调为中性且有用。我们发现这些 DReST 代理在测试时在未见过的环境中泛化为中立且有用。事实上,DReST RL 代理在我们的测试集上比基线代理实现了 11% (PPO) 和 18% (A2C) 高的有用性,并且我们经过微调的 LLM 实现了最大的有用性和接近最大的中性。我们的结果提供了一些早期证据,表明 DReST 可用于训练更先进的智能体,使其变得有用且中立。先前的理论工作表明这些代理是有用的并且可以关闭。

迈向可关停智能体:RL智能体与LLM中随机性选择的泛化
图 1:满足 POST 的首选项示例,转载自 Thornley 等人。 (2025)。每个 s i s_{i} 代表一条短轨迹,每个 l i l_{i} 代表一条长轨迹,≻ \succ 代表一个偏好。