论文
在检索和硬件限制下评估土耳其域名文档的开放权重大语言模型
Evaluating Open-Weight LLMs for Turkish Domain Documents Under Retrieval and Hardware Constraints
摘要
大多数支持土耳其语的大型语言模型 (LLM) 都是使用通用基准而不是冗长、结构复杂的领域文档进行评估的。本文评估了资源受限的本地部署设置下用于土耳其语文档问答的五种开放权重 7B-8B 模型。主要基准包含来自 109 页工业研发报告的 100 个经过系统验证的问题,并且使用第二份 112 页公共部门报告和独立构建的 100 个问题集复制评估协议。所有模型均在具有 6 GB VRAM 的 NVIDIA RTX 3050 笔记本电脑 GPU 上使用受控提示、解码和 4 位量化进行本地评估。主要的方法贡献是一个有证据注释的评估协议,它将检索失败与下游模型推理失败分开,而不需要额外的模型调用。在主要基准测试中,端到端准确度范围为 49% 到 75%。另外使用 95% Wilson 间隔和精确配对 McNemar 测试对七种词汇、密集和混合检索配置进行了比较;在任一文档上,没有一个明显优于字符 TF-IDF 基线。两份报告的证据回忆饱和程度不同,这表明检索和有效的上下文能力可能对某些文档产生约束力,但对其他文档则不然。这些结果表明,在为土耳其域文档部署开放权重大语言模型时,必须单独评估模型选择、检索行为和硬件限制。