论文

GoodPoint:从作者回复中学习建设性的科学论文反馈

GoodPoint: Learning Constructive Scientific Paper Feedback from Author Responses

模型训练偏好优化

摘要

尽管大语言模型(LLM)在变革科学研究方面潜力巨大,我们主张将其用于增强和赋能研究者,而不是在缺乏人类监督的情况下自动化研究。为此,我们研究建设性反馈生成这一任务,即生成有针对性、可操作的反馈,帮助作者改进其研究及其呈现方式。在本工作中,我们沿有效性与作者行动这两个以作者为中心的轴来操作化反馈的有效性。我们首先构建了GoodPoint-ICLR数据集,包含19K篇ICLR论文,利用作者回复沿这两个维度对审稿人反馈进行标注。在此基础上,我们提出GoodPoint训练配方,通过在有效且可操作的反馈上进行微调来利用作者回复中的成功信号,并在真实与合成偏好对上开展偏好优化。我们在包含1.2K篇ICLR论文的基准上的评估显示,经GoodPoint训练的Qwen3-8B将预测成功率较基础模型提升83.7%,并在人工参考反馈集上的反馈匹配中创下同等规模LLM中的新最优水平,在精确率上甚至超过Gemini-3-flash。我们进一步通过专家人类研究验证了这些发现,表明在作者感知中GoodPoint始终带来更高的实用价值。

GoodPoint:从作者回复中学习建设性的科学论文反馈:论文配图
图 1:两个反馈质量轴的概述以及我们对建设性反馈的定义。审稿人的反馈从两个维度进行评估:有效性(提出的问题是否得到作者的同意)和可操作性(是否促使具体的后续行动)。我们认为有效且可操作的反馈是成功的,并建立了实施这一定义的训练和评估框架。