论文
专业决策模型与通用LLM:跨知识、推理和多语言任务的 Jev 基准测试
Specialized Decision Models vs. General-Purpose LLMs: Benchmarking Jev Across Knowledge, Reasoning, and Multilingual Tasks
摘要
Jev 是一个“System One”模型,它返回给定选项中的选择,而不是生成文本。我们研究了这种专门的决策模型与通用大型语言模型(LLM)的比较。我们根据涵盖知识、推理和多语言理解的 13 个多项选择基准对 Jev 进行评估,并将其与前沿、代表性和小型三个级别的 19 个LLM进行比较。 Jev 在知识和常识基准方面与前沿LLM具有竞争力,并在 MMLU-Redux 和 ARC-Challenge 上获得最高分。除了数学之外,它的表现也优于最具代表性的LLM和所有小型LLM。然而,它在数学应用题上落后了:在 MathQA 上,它比前沿中位数低 17.7 分,并且分数低于所有 19 个LLM。这些结果表明,专门的决策模型可以在主要依赖于知识的决策上与通用LLM相匹配,但在需要多步骤计算的决策上却无法匹配。