论文

闭合反馈回路:从经验抽取到洞见治理的言语强化学习

Closing the Feedback Loop: From Experience Extraction to Insight Governance in Verbal Reinforcement Learning

智能体系统上下文与知识记忆Agent SkillsAgent记忆

摘要

免训练的言语强化学习使LLM智能体从世界反馈中学习——客观信号如动态任务结果、市场回报或需求预测——经从经验抽取言语规则并作为上下文注入——无需参数更改即更新智能体行为。但在非平稳环境中这些智能体面临保持-遗忘困境:保留过时洞见造成负迁移——丢弃它们则在条件复现时造成灾难性遗忘。我们识别穿越该困境的四个要求——结果驱动评估、持久结构化证据、非单调知识生命周期与组合式治理——并表明既有方法在经验抽取上重投入——而在洞见治理上投入不足。我们提出三层架构——规则、证据与技能——由反馈驱动的策展回路连接以闭合治理缺口。规则捕获从世界结果蒸馏的经验;证据日志追踪每条规则跨episode的可靠性;技能治理应用哪些规则、如何消解冲突、何时弃权。以金融预测为案例研究——世界反馈天然丰富、带噪且非平稳——我们表明同一批积累经验要么使性能退化到零样本基线之下、要么大幅提升准确率与风险调整回报——取决于策展回路是否存在。