论文

LLM 的摩擦策略优化:认知干预、风险敏感控制和反思性调整

Frictive Policy Optimization for LLMs: Epistemic Intervention, Risk-Sensitive Control, and Reflective Alignment

模型训练偏好优化

摘要

我们提出摩擦策略优化(FPO),这是一个学习语言模型策略的框架,它不仅规范说什么,还规范何时以及如何进行干预,以管理认知和规范风险。与优化表面偏好或任务效用的标准对齐方法不同,FPO 将澄清、验证、挑战、重定向和拒绝视为明确的控制操作,其目的是随着时间的推移塑造信念、承诺和不确定性的演变。我们将一致性形式化为一个风险敏感的认知控制问题,其中干预决策的选择基于其对下游认知质量的预期影响,而不是仅基于即时奖励。我们引入了摩擦干预的紧凑分类法、可操作多种对齐失败模式的结构化摩擦函数,以及涵盖奖励塑造、偏好配对、群体相对排名和风险条件信任区域的统一 FPO 方法系列。我们进一步提出了一个评估框架,通过澄清行为、校准、矛盾修复、拒绝比例和信息效率直接衡量认知能力。总之,这些结果为学习代理提供了形式和算法基础,这些学习代理不仅在结果上而且在认知行为上都是一致的。