论文

比较土耳其 RAG 系统的分块和嵌入策略

Comparing Chunking and Embedding Strategies for Turkish RAG Systems

模型评测模型能力评测

摘要

检索增强生成以从文档集合检索到的块为语言模型的条件。因此,它的准确性受到确定可检索内容的分块和嵌入阶段的限制。我们比较了土耳其语文档问答的三种分块策略(固定长度、语义和布局感知文档)、五种嵌入模型和两个 LLM,以及三个具有对比布局的文档。每个配置都回答相同的问题集,这允许通过配对测试来区分组件效果,而不是从单独的基准中推断出来。完全交叉的设计产生 9{,}000 个分级问答评估,每个评估均由独立的判断模型评分,并且组件比较通过 Holm 校正下的配对 McNemar 检验进行测试。三种主要的嵌入模型在统计上是无法区分的,因此语言专业化不会产生可测量的检索优势。 LLM 并不是越快就越准确。首选配置取决于内容类型,因为布局感知分块对表格较多的文档的帮助远远大于文本较多的文档。