论文

人类创造力基准

The Human Creativity Benchmark

模型评测基准与评测资源

摘要

现代AI评估框架把评估者分歧当需解决的噪声。在创意领域,专业分歧反映品味的真正差异而非测量误差。我们论证评估创意AI需要保留两个不同信号:汇聚——专业人士围绕共同最佳实践对齐;分歧——个人品味合理地变化。我们提出人类创造力基准(HCB):通过从领域专业人士收集成对偏好、对标提示遵循度、可用性与视觉吸引力的标量评分以及定性理由来操作化该分离。跨五个创意领域与三个工作流阶段(构思、草图、精修)的15,000条专业判断:汇聚集中在可验证维度如技术正确性与视觉层级,分歧集中在品味驱动维度如美学方向与概念风险。没有模型在所有阶段全面出色。把这些信号坍缩为单一质量指标丢弃了最可操作的信息。

人类创造力基准:论文配图
图 1. 横向马提尼酒的创作过程:通过模型缩小广泛的构思,最后以细化结束。示例剧照取自根据提示呈现的广告图像;提示源自专业样本。