论文

通过隐式对抗偏好优化进行健康指导的双智能体协同训练

Dual-Agent Co-Training for Health Coaching via Implicit Adversarial Preference Optimization

模型训练偏好优化

摘要

基于动机访谈的健康辅导是改善心理健康和促进健康行为改变的有效方法。然而,训练有素的教练的稀缺以及教练服务的高昂成本使得许多本来可以从中受益的人无法获得这种支持。这激励了人工智能健康教练的发展,这些教练可以提供可扩展且负担得起的支持。现有方法通常仅优化交互的一侧:它们要么针对固定​​客户端环境训练对话代理,要么针对固定​​助手训练客户端模拟器。这种片面的设置会限制对交互空间的探索,并且在开发目标代理所需的功能和突破其性能边界方面可能效率低下。在本文中,我们提出了一个双代理框架,可以交互式地共同训练健康教练代理和客户端模拟器。该教练使用由多维 LLM 法官识别的帕累托主导响应对通过 DPO 进行优化。反过来,通过逆转这些偏好来对客户进行对抗性训练,从而引发隐式的对抗性训练动态。我们进一步表明,这种协同训练过程承认自然的随机博弈解释。大量的实验表明,我们的方法有效地提高了几个重要维度的辅导质量。