论文

PIHF:以人类反馈迭代策略,将后训练RL思路引入上下文学习

Policy Iteration with Human Feedback: Bringing Post-Training RL to In-context Learning

智能体系统模型训练强化学习Agent HarnessAgentic RL

摘要

生成式预训练建立了可复用的任务表示;后续的语言任务条件化与上下文学习研究表明,固定模型能依据指令和示例调整行为。带人类反馈的策略迭代(Policy Iteration with Human Feedback,PIHF)建立在这一进展和广义策略迭代反复评估、改进的结构之上。PIHF将预训练语言模型作为执行基础,把持久修订放到有版本管理的自然语言策略和工具集中。语言模型评审者与临床专家检查完整诊断面板上的推理及工具使用轨迹,定位反复出现的失败并形成候选修订;专家可以重新解释证据,并保留修订准入和回滚的决定权,候选执行后则通过Recall@1和Recall@5验证结果。在累积消融实验和超罕见病基准上,PIHF生成的策略改善了一个专有执行模型与三个开放权重执行模型的Recall@1,后者的激活参数规模为30亿至490亿。GPT-5.4和Qwen3.6-35B分别提升32.7和31.1个百分点,文中报告两者增益相差1.7个百分点。这些结果支持在罕见病诊断中,将预训练语言模型作为固定权重的执行基础、由专家指导策略开发的可行性。