论文
HoWToBench:使用写作树全面评估LLM的人类水平写作能力
HoWToBench: Holistic Evaluation for LLM's Capability in Human-level Writing using Tree of Writing
摘要
由于写作技能的多维性质和现有指标的局限性,评估 大语言模型 (LLM) 的写作能力仍然是一项重大挑战。通过传统的基于参考的指标或现代的 LLM 作为评判方法,无法充分评估 LLM 在千字级和开放式写作中的表现。我们提出了写作树(ToW),以解决 LLM-as-a-judge 聚合文本评估中所有子特征时经常发现的隐式不一致。 ToW 通过显式建模子特征的聚合权重来合并树形结构的工作流程。我们还推出了 HowToBench,这是一个大型中文写作基准测试,涵盖 12 个体裁和 1302 条指令,涵盖三个任务类别:上下文完成、大纲引导写作和开放式生成。 ToW 成功地减轻了偏差,与人类判断的皮尔逊相关性达到 0.93。此外,我们发现基于重叠的文本生成指标和流行的 LLM 作为法官实践都容易受到文本干扰,而 ToW 对它们来说很稳健。我们还发现了 Guide 任务中输入长度和内容相关分数之间的负相关性,这表明它不能简单地通过输入端信息堆积来改进。