论文

好的写作可以生成吗?基于高质量书籍微调涌现的专家级AI写作

Can Good Writing Be Generative? Expert-Level AI Writing Emerges through Fine-Tuning on High-Quality Books

模型评测模型能力评测

摘要

创意写作长期被认为是人类独有的活动,需要机器无法复制的声音和风格。这一假设正受到生成式AI的挑战,后者可在数秒内模仿数千位作者的风格,边际劳动几乎为零。为更好地理解这一点,我们开展了一项行为实验:28位MFA作家(专家)与三个LLM在模仿50位广受好评的作者方面竞技。基于28位专家评委和131位普通评委的盲评成对比较,我们发现:在上下文提示条件下,专家在82.7%的情况下偏好人类写作;但在对作者全部作品微调后,偏好逆转为62%偏好AI。然而,普通评委始终偏好AI写作。对专家作家的事后访谈显示,他们对AI写作的偏好引发了身份危机,侵蚀了审美自信,并动摇了何为“好写作”的认知。这些发现挑战了关于AI创作局限的论述,并对创意劳动的未来提出根本性问题。

好的写作可以生成吗?基于高质量书籍微调涌现的专家级AI写作
图1. 三阶段研究设计,展示(阶段 1)使用风格/声线广受好评的作者进行写作任务的 In-context prompting 与微调方法。图中人类作者与 AI 均尝试以 Ottessa Moshfegh 的风格/声线撰写 My Year of Rest and Relaxation 中的一个特定片段(阶段 2)附带理由的人类写作与 AI 生成文本评估任务,以及(阶段 3)探讨当作者偏好 AI 而非人类写作时的情绪与意义建构的汇报环节。图由论文第一作者绘制。三联画式研究设计示意:阶段 1 显示人类作者与 AI 系统都尝试以作者 Ottessa Moshfegh 的风格写作,AI 使用 in-context prompting 或在该作者作品上微调;阶段 2 显示评估者并排比较人类写作与 AI 生成的文本,给出偏好判断与书面理由;阶段 3 描绘汇报访谈环节,参与者讨论得知 AI 比人类写作更受偏好后的反应。