论文

Prosa:基于评分标准的 LLM 对巴西葡萄牙语真实用户聊天的评估

Prosa: Rubric-Based Evaluation of LLMs on Real User Chats in Brazilian Portuguese

模型评测基准与评测资源

摘要

由整体 LLM 作为评委评分产生的排名对所选评委模型的偏差很敏感。我们证明,切换到具有多评判过滤的二元评分标准可以消除这种敏感性:分解评判比评判模型本身更重要。为了支持这一说法,我们引入了 Prosa,这是第一个真实用户多回合巴西葡萄牙语聊天基准:由来自三个模型系列的三名评委在 16 个模型上对 1,000 个 WildChat 对话进行评分。在过滤标题评分下,三位评委对 16 个排名中的每一个都达成一致,而在整体评分下,他们只对 16 个排名中的 7 个达成一致。此外,标题过滤管道将相邻模型之间的平均分数差距增加了 47%,从而提高了 Prosa 的判别能力。当使用 Gemini 3 Flash 作为评判时,在 Prosa 上评估一个新模型的成本约为 2.1 美元。我们发布基准和过滤代码,以确保未来的模型可以在相同的条件下进行评估。这些工件还使我们基于评分标准的评分方法可以在 Prosa 之外重复使用,支持其他开放式评估设置。