论文
在保险核保环境中对智能体进行基准测试
Benchmarking Agents in Insurance Underwriting Environments
摘要
随着AI智能体融入企业应用,其评估需要能反映真实运营复杂性的基准。而现有基准过度聚焦代码等开放领域,使用狭窄的准确率指标,且缺乏真实复杂性。我们提出UNDERWRITE,一个专家优先、多轮保险核保基准,与领域专家密切合作设计,以捕捉真实企业挑战。UNDERWRITE引入当前基准常缺失的关键真实性因素:专有业务知识、带噪工具接口,以及需要审慎信息收集的不完美模拟用户。评估13个前沿模型后,我们发现研究实验室表现与企业就绪度之间存在显著差距:最准确的模型并非最有效率,模型即使能访问工具仍会幻觉领域知识,pass^k结果显示性能下降20%。UNDERWRITE的结果表明:专家参与基准设计对真实智能体评估至关重要;常见agentic框架存在扭曲性能报告的脆弱性;专业领域的幻觉检测需要组合式方法。我们的工作为开发更契合企业部署要求的基准提供洞见。
