论文

为人工智能研究手稿生成编辑诱导问题

Generating Edit-Inducing Questions for AI Research Manuscripts

模型评测模型能力评测

摘要

我们研究大语言模型提出编辑诱导问题的能力,这些问题的答案将改善论文草稿。在来自 ICLR 和 NeurIPS 的配对提交论文和可上架论文的数据集上,我们将带有或不带有完整论文上下文的 GPT 模型中的问题与人类审稿人的问题的有用性进行了比较。与审稿人的问题相比,GPT 会产生更多的编辑诱导问题,并且其问题与更广泛的编辑相关,并且涵盖更广泛的编辑内容。然而,GPT 问题中涉及编辑的问题所占比例要小得多。我们的分析证实,自动化问题对作者有益,并强调了一个示例任务,其中正确关注长上下文会降低推理模型产生有用输出的能力。