论文

智能体检索与强化学习方程链:受控生成

Agentic Retrieval and Reinforcement Learned Equation Chains: A Controlled Generation Framework for Complex and Novel Physics Word Problems

应用与实践模型训练强化学习内容创作Agentic RL

摘要

生成新颖、复杂且可解决的高质量物理应用题 (PWP) 仍然是教育内容生成中的一个具有挑战性且尚未得到充分探索的问题。现有的方法,许多改编自数学应用题(MWP)生成,通常会产生含糊不清、无法解决或结构简单且语言多样性有限的问题。我们引入 ARVRE(代理检索价值强化方程链),这是一个用于生成多样化且数学上有效的 PWP 的两阶段框架。在第一阶段,使用离线时差学习的形式构建有效的物理方程链,而代理检索增强生成(RAG)框架动态选择特定主题的概念和词汇。这种设计可以对问题结构和难度进行明确的控制。在第二阶段,大型语言模型(LLM)将方程链和检索到的概念转换为自然语言物理问题。通过将生成建立在有效的方程链中,我们的方法保留了数学正确性,同时促进了语言多样性和上下文丰富性。人工和自动评估表明,ARVRE 生成的 PWP 比现有方法生成的 PWP 更复杂、新颖且可解决。这些结果凸显了将强化学习、检索和大语言模型结合起来可靠生成教育物理内容的潜力。

智能体检索与强化学习方程链:受控生成:论文配图
图 4:根据简单运动定律主题构建的玩具方程图,通过共享变量(边)说明方程(节点)之间的关系。