论文

风格胜,实质败:对 LLM 作为创意生成法官的诊断

Style Wins, Substance Loses: A Diagnosis of LLM-as-Judge in Idea Generation

模型评测基准与评测资源

摘要

然而,这些法官是否真正评估了思想的科学实质,还是受到肤浅文体表述的影响,仍然是一个悬而未决的问题。为了解决这个问题,我们提出了 SciStyleBench,一个统一的三部分基准,用于诊断和减轻基于 LLM 的想法评估中的文体偏差:(i)首先,SciStyleStage,一个三阶段评估环境,它将受控的文体扰动应用于跨无上下文、固定域上下文和开放域检索上下文三种设置的固定科学内容,涵盖 600 个科学想法和 15 种风格变体,每个设置 9,000 个评估实例; (ii) 其次,SciStyleMetrics,一组量化指标,包括风格偏差指数 (SBI)、物质识别率 (SRR) 和对抗胜率 (AWR),用于描述风格变化如何影响评分稳定性、物质区分度和排名稳健性; (iii) 第三,SciStyleExtractor,一个即插即用的评估模块,通过在风格条件评估之前预测风格类型和偏差,将演示风格与科学内容分开,使我们能够评估风格意识是否减少了风格偏差。 SciStyleBench 上的实验表明,直接 LLM 评委对写作风格仍然敏感,并且很难区分科学实质。相比之下,SciStyleExtractor 将 SBI 从 0.566 降低到 0.501,同时将 SRR 和 AWR 分别从 0.504 和 0.554 增加到 0.759 和 0.899。这些结果表明,稳健的想法评估需要对风格变化保持不变,同时又不牺牲对科学实质的敏感性。总体而言,SciStyleBench 提供了一个系统框架,用于识别、量化和减轻科学思想评估中的文体偏见。