论文
环境能为自己发声吗?T²-GRPO:面向照护者智能体的轮次-轨迹组相对策略优化
Can the Environment Speak for Itself? $T^{2}$-GRPO: A Turn-Trajectory Group Relative Policy Optimization for Caregiver Agents
摘要
为长期护理人员优化大语言模型 (LLM) 需要平衡延迟的任务目标与即时环境动态,例如患者的痛苦和抵抗。在痴呆症护理中,这种平衡尤其困难:轨迹级别的奖励对于回合级别的信用分配来说太稀疏,而基于大语言模型的外部评估人员成本高昂,并且可能会误读零碎或间接的患者反应。为了解决这个问题,我们提出 \textbf{T}urn-\textbf{T}rajectory \textbf{G}roup \textbf{R}elative \textbf{P}olicy \textbf{O}ptimization (\textbf{T$^{2}$-GRPO}),这是一个框架,将护理者 RL 解耦为两个标准化奖励范围,并通过二进制硬否决来强制安全。 $T^2$-GRPO 直接从环境状态转换中获得密集的转弯级别奖励,测量患者痛苦的变化和冷冻痴呆患者模拟器的抵抗力。这些基于环境的奖励通过独立的中心排名归一化与轨迹级评估相结合,从而保留了异构奖励信号并减轻了奖励崩溃。针对痴呆症护理人员的大量实验表明,T $^{2}$-GRPO 的表现优于竞争基线,这表明情绪敏感的护理人员场景得到了实质性改善,可以有效处理即时患者反馈、长期护理结果和安全约束。
