论文

在保险核保环境中对智能体进行基准测试

Benchmarking Agents in Insurance Underwriting Environments

智能体系统Agent任务评测

摘要

随着AI智能体融入企业应用,其评估需要能反映真实运营复杂性的基准。而现有基准过度聚焦代码等开放领域,使用狭窄的准确率指标,且缺乏真实复杂性。我们提出UNDERWRITE,一个专家优先、多轮保险核保基准,与领域专家密切合作设计,以捕捉真实企业挑战。UNDERWRITE引入当前基准常缺失的关键真实性因素:专有业务知识、带噪工具接口,以及需要审慎信息收集的不完美模拟用户。评估13个前沿模型后,我们发现研究实验室表现与企业就绪度之间存在显著差距:最准确的模型并非最有效率,模型即使能访问工具仍会幻觉领域知识,pass^k结果显示性能下降20%。UNDERWRITE的结果表明:专家参与基准设计对真实智能体评估至关重要;常见agentic框架存在扭曲性能报告的脆弱性;专业领域的幻觉检测需要组合式方法。我们的工作为开发更契合企业部署要求的基准提供洞见。

在保险核保环境中对智能体进行基准测试
图2:我们的专家参与过程示意:与其他基准开发方法一样,专家审查并策展单个任务(上图)。此外,他们还作为一个团队协作,更整体地开发该系统,将其塑造为对产品后端的表示,包含真实的业务规则与数据表(下图)。