论文

TIAO:文本摘要的词元重要性感知策略优化

TIAO: Token Importance-Aware Policy Optimization for Text Summarization

模型训练强化学习

摘要

文本摘要需要模型压缩内容,同时保持一致性和连贯性等关键品质。大型语言模型(LLM)在这项任务上表现出了强大的性能,并且可以通过强化学习(RL)进一步改进。然而,大多数现有方法将奖励信号直接应用于未区分的标记序列,忽略了单个标记对摘要中单词和句子级别质量的不同重要性。在本文中,我们提出了词元重要性感知策略优化(TIAO),这是一种明确利用词元重要性感知的新型强化学习策略。具体来说,TIAO 根据词元依赖性来识别核心词元,并根据其总体依赖性重新加权轨迹的优势。在现实世界数据集上的实验表明,我们的 TIAO 取得了极具竞争力的结果,并且由 TIAO 增强的 7B 基础模型的性能与 GPT-4 和 GPT-5-nano 相当。代码可在 https://github.com/TechCloud-x/TIAO 获取