论文

IndicBankBench:评测语言模型助手在印度零售银行业的安全性与可靠性

IndicBankBench: Evaluating Safety and Reliability of Language Model Assistants in Indian Retail Banking

智能体系统Agent任务评测

摘要

银行助手必须使用账户特定信息回答请求,且在很多情况下需通过工具采取行动。只评测最终回复会漏掉重要错误。助手可能询问它已拥有的信息、依赖过时上下文、选择错误账户,或在说出正确值后写入无效值。我们提出IndicBankBench,一个面向印度零售银行的799案例基准,覆盖五个运营域、一个能力/拒答域和二十个主轴。案例在四个阶段评测:安全、行动与工具使用、回复充分性和咨询质量。工具使用和大多数安全检查是确定性的。一个狭窄的解析器只处理写入前确认的模糊情形,而由另一个独立的LLM裁判评估语义回复充分性。每个案例运行三次并报告严格的pass^3,要求所有尝试均成功。在11个被评测模型中,严格可靠性从43.7%到58.2%,而至少一次成功从60%到74%。这一差距表明至少一次成功会夸大可依赖的银行行为。案例级诊断还能区分问不必要问题的系统与行动却未能调和客户上下文或完全解决请求的系统。我们发布案例、模拟环境和评测框架。