论文

ActuBench:用于精算推理任务生成与评估的多智能体LLM管线

ActuBench: A Multi-Agent LLM Pipeline for Generation and Evaluation of Actuarial Reasoning Tasks

模型评测基准与评测资源

摘要

我们提出ActuBench,一个用于自动生成与评估与国际精算师协会(IAA)教育大纲对齐的高级精算测评题目的多智能体LLM管线。该管线按适配器区分四种LLM角色:一个智能体起草题目,一个构造干扰项,第三个独立验证前两个阶段并驱动有界的一次性修复循环,还有一个成本优化的辅助智能体负责维基百科笔记摘要与主题标注。题目、各模型回答及完整排行榜以可浏览的网页界面发布于 https://actubench.de/en/,读者与从业者无需检出仓库即可查看具体题目。我们在两个互补基准上评测来自八家提供商的50个语言模型——100道经验上最难的选择题和100道由LLM裁判评分的开放式题目——并报告三项主要发现。第一,多智能体验证不可或缺:独立验证者在首轮就标记了大多数起草的题目,其中大部分由一次性修复循环解决。第二,本地托管的开源权重推理处于性价比Pareto前沿:在消费级硬件上运行的Gemma~4模型和Cerebras托管的120B开源权重模型主导了近零成本区间,后者距榜首仅一题之差。第三,选择题与LLM-as-Judge的排名存在实质差异:选择题框架夸大了性能上限,需要裁判模式评估才能在前沿模型间做出区分。