论文
K-FinHallu:韩国金融中多轮 RAG 的幻觉检测基准
K-FinHallu: A Hallucination Detection Benchmark for Multi-Turn RAG in Korean Finance
摘要
大语言模型 (LLM) 通过检索增强生成 (RAG) 实现了先进的财务自动化,但幻觉仍然是高风险环境中部署的关键障碍。现有的基准侧重于单轮、以英语为中心的任务,而没有解决韩国金融领域的多轮动态和语言监管的细微差别。我们推出 K-FinHallu,这是多轮韩国金融 RAG 中第一个幻觉检测基准。我们根据真实的韩国金融文件构建了多轮对话,并根据上下文责任性(明确解释了合理的弃权)提出的分层分类法注入了幻觉。将前沿和开源 LLM 作为幻觉检测器进行基准测试,我们发现即使是最强大的模型也难以应对细粒度的金融诊断和拒绝行为。虽然我们的训练分割中的 微调 8B 模型产生的性能可与前沿 LLM 竞争,但合理弃权仍然是所有评估模型中最薄弱的轴。