论文

通过结构感知策略学习,将论文引言写作流程内化到模型中

Internalizing Academic Writing Workflows for Introduction Generation via Struct-Aware Policy Learning

模型训练强化学习

摘要

用LLM生成严谨论文引言,需要在连贯叙述中协调背景、研究缺口、方法与贡献,仍具挑战。现有方法以多阶段提示或智能体工作流组织写作,成本较高,也容易出现阶段之间的内容偏移。本文提出结构感知策略学习框架StructPO,把整个多阶段写作流程内化为由显式阶段词元控制的单次生成策略。结构感知信用分配将局部阶段质量与整体连贯性解耦,修改引导优化则把修订行为内化到首次生成策略。实验显示,相较工作流基线,StructPO改善语义对齐、结构合理性和推理效率,并能泛化到分布外设置。扩展至Qwen3-32B时,其人工评价表现与GPT-5.1相当。结果表明,细粒度策略优化可以把学术写作流程内化为模型能力,成为高成本外部编排的一种替代方式。