论文
CriticGen:面向生成结果的评价与可执行反馈
CriticGen: Generation-Aware Evaluation as Actionable Feedback
摘要
当前大型语言模型的评估方法是粗粒度的,并且与生成分离,产生的通用解释无法为模型改进提供可操作的反馈。我们提出了 CriticGen,这是一个细粒度、世代感知的评估框架,可将评估转化为可操作的控制,以改进答案。 CriticGen 首先在主观、客观和自衍生约束等高级类别下生成特定于样本的评估维度和评分标准。然后,这些标准充当动态评分标准,用于共同生成分数、原因、可执行的改进建议和改进的答案。这种以标题为条件的细化过程使模型能够诊断缺陷并执行有针对性的答案改进。实验结果表明,细粒度的评估应该既针对具体实例又具有可操作性。 CriticGen 引入了更高质量的评分标准,将相关性/覆盖率从 3.33/4.03 提高到 3.97/4.24。 CriticGen 还实现了最佳得分相关性,Pearson 为 0.9556,Spearman 为 0.9560,并将基于标准的理由和可执行建议的 F1 从 0.6369/0.5994 提高到 0.7554/0.7900。至关重要的是,它的反馈转化为可靠的答案改进,改进了 73.17% 的答案,且未降级率为 93.28%。
