论文

从上下文到技能:语言模型能巧妙地从上下文学习吗?

From Context to Skills: Can Language Models Learn from Context Skillfully?

智能体系统Agent Harness

摘要

许多现实世界的任务需要语言模型(LM)对超出其参数知识的复杂上下文进行推理。这就需要上下文学习,LM 直接从给定的上下文中学习相关知识。一个直观的解决方案是推理时技能增强:将规则和过程从上下文中提取为自然语言技能。然而,为情境学习场景构建此类技能面临着两个挑战:对于冗长、技术密集的情境,手动技能注释的成本高昂,并且缺乏自动化技能构建的外部反馈,因为没有自动信号来判断所提出的技能是否有帮助。在本文中,我们提出了 Ctx2Skill,这是一个自我进化的框架,可以自主发现、完善和选择特定于上下文的技能,而无需人工监督或外部反馈。多智能体自我对弈循环的核心是一个生成探索任务和规则的挑战者、一个试图在不断发展的技能集指导下解决这些问题的推理者和一个提供二元反馈的中立法官。至关重要的是,挑战者和推理者都是通过积累技能来发展的:专门的提议者和生成者代理分析失败案例并将其综合为双方有针对性的技能更新,从而实现自动化技能发现和完善。为了防止日益极端的任务生成和过度专业化的技能积累所导致的对抗性崩溃,我们进一步引入了跨时间重放机制,该机制可以识别在 Reasoner 端的代表性案例之间实现最佳平衡的技能集,从而确保稳健且可泛化的技能进化。由此产生的技能可以插入任何语言模型中,以获得更好的上下文学习能力。通过对 CL-bench 的四个上下文学习任务进行评估,Ctx2Skill 持续提高了骨干模型的解决率。

从上下文到技能:语言模型能巧妙地从上下文学习吗?
图 1:Ctx2Skill 示意图。它旨在将上下文中的规则和程序提取为自然语言技能,无需人工注释和外部反馈。