论文
INS-ActBench:大语言模型专业精算能力综合评估基准
INS-ActBench: A Comprehensive Benchmark for Assessing Professional Actuarial Capability of Large Language Models
摘要
大语言模型 (LLM) 在金融推理方面表现出了强大的潜力,但现有的基准测试通常在单独的设置中评估领域知识、数字推理、长上下文理解和工具使用。这限制了他们评估实际专业工作流程的能力,这些工作流程需要可审核、基于上下文和工具可执行的决策。我们在LLM中引入了评估专业精算能力的综合基准\textbf{INS-ActBench}。 INS-ActBench 包含 12,050 个来自公开考试的问答对以及 16 个精算协会发布的样题。它涵盖三个子集:\textbf{INS-Act-Know} 用于标准化精算知识,\textbf{INS-Act-Case} 用于长上下文保险案例推理,\textbf{INS-Act-Practice} 用于具有可验证数值输出的电子表格和 R 代码任务。对九位代表性 LLM 和人类精算专家的实验揭示了清晰的能力边界:前沿 LLM 在标准化知识上表现强劲,但在案例推理、基于工具的工作流程和管辖权敏感实践方面仍然较弱。 INS-ActBench 为开发精算 LLM 以获得可靠的专业帮助提供了可重复的基础。代码可在 https://github.com/FDU-INS/INS-ActBench 获取。