论文

商业创意评估中的总体评判与个性化评判:来自专家分歧的证据

Aggregate vs. Personalized Judges in Business Idea Evaluation: Evidence from Expert Disagreement

模型评测评测方法与指标

摘要

评估 LLM 生成的业务创意通常比生成它们更难扩展。与标准 NLP 基准不同,商业创意评估依赖于可行性、新颖性、差异化、用户需求和市场规模等多维度标准,而专家的判断往往不一致。本文研究了由这种分歧引发的方法论问题:自动法官应该近似总体共识,还是单独为评估者建模?我们引入了 PBIG-DATA,这是一个包含 300 个基于专利的产品创意的约 3,000 个个人评分的数据集,由领域专家在六个面向业务的维度提供:特异性、技术有效性、创新性、竞争优势、需求有效性和市场规模。分析显示,专家们对细粒度序数分数存在很大分歧,而粗略选择下的一致性更高,这表明结构异质性而不是随机噪声。然后,我们比较三种法官配置:仅包含标题的零样本法官、以混合评估者历史为条件的聚合法官,以及以目标评估者的评分历史为条件的个性化法官。在维度和模型大小方面,个性化法官与相应评估者的一致性比总体法官更紧密,并且评估者的一致性仅在个性化条件下与法官生成的推理的相似性相关。这些结果表明,混合标签在多元评估环境中可能是一个脆弱的目标,并激发了以评估者为条件的判断设计来进行商业创意评估。