论文

定义:用于辩论场景中细粒度创造力评估的数据高效计算框架

DEFINED: A Data-Efficient Computational Framework for Fine-Grained Creativity Assessment in Debate Scenarios

模型评测评测方法与指标

摘要

在大语言模型时代,人类创造力已成为一项关键能力。在复杂、开放的环境中评估创造力是数据挖掘中的一项巨大挑战,目前由于对标准化简单任务的依赖和细粒度专家数据的稀缺而受到阻碍。作为一种生态上有效的评估环境,辩论反映了创造力的多个维度,包括发散性思维和聚合性思维。此外,辩论是一个数据丰富的领域,拥有大量可公开获取的材料。当前主流的自动评分方法不太适合辩论等复杂环境,因此仍然依赖于昂贵的人工评估。为此,本文提出了DEFINED,一种数据高效的计算框架,用于辩论场景中细粒度的创造力评估。 DEFINED 通过分层八维度量系统来操作辩论创造力,该系统通过预先训练的自回归语言模型实现,该模型具有支持细粒度和粗粒度评估的分层评分头。陈述及其相关的专家分数是从真实的辩论比赛中获得的,并采用受限数据增强策略来解决原始数据中固有的精英偏见。 DEFINED 采用混合粒度的训练策略,可以从训练有素的研究生专家注释的有限细粒度监督中进行稳健的学习。为了严格验证超越综合基准的生态有效性,我们与未经辩论的参与者进行了实证研究,利用这些真实数据作为中低熟练人群的定性案例研究。在我们的评估协议中,我们的评分模型实现了准确且稳定的评分,优于基于提示的 大语言模型 评估器和现有的辩论评分方法。