论文

InsClaimBench:贯穿保险理赔决策链的LLM基准

InsClaimBench: Benchmarking Insurance Claim Adjudication Across the Decision Chain

模型评测应用与实践基准与评测资源鲁棒性、公平性与可信度评测行业应用

摘要

面向推理的大语言模型(LLM)的最新进展促使人们越来越多地评估其执行专业决策任务的能力。保险索赔裁决就是这样一项任务,需要模型在结构化决策过程中连接案例证据、保险规则、中间判断和赔付计算。我们推出 InsClaimBench,这是一个用于评估整个决策链的保险索赔裁决的端到端基准。 InsClaimBench 基于真实索赔材料和结构化保险规则,包含汽车、财产和健康保险领域 375 个案例系列的 3,780 个案例,包括 86,656 个原子规则判决。它评估从原子规则到裁决模块再到支付决策和金额的每项索赔,并使用受控事实变体测试所需的更改是否正确地跨级别传播。对六名LLM的评估显示,决策链的可靠性逐渐丧失。支付决策准确度范围为 74.23--80.19%,而联合决策金额准确度则降至 47.54--73.15%。 强大的本地性能也无法确保案例级别的正确性:原子规则准确率达到 95.48%,而规则向量精确匹配峰值仅为 36.90%,并且最常见的模块错误不一定是与最终决策失败最相关的错误。在事实变化下,这些不一致进一步变成传播失败:模块更新不如规则更新可靠,正确的本地判断仍然会产生错误的支付,而正确的支付会掩盖中间错误。这些结果表明,可靠的索赔裁决需要整个决策链的一致组成和传播。

InsClaimBench:贯穿保险理赔决策链的LLM基准:论文原图
图 1:InsClaimBench 概述。举例说明端到端索赔裁决流程,包括原子规则判断、裁决模块、索赔决策以及受控事实变化下的赔付结果。