论文
ESG领域开源大模型RAG的实证评估
Empirical Evaluation of Open-Source Large Language Models for Retrieval-Augmented Generation in ESG Domain
摘要
环境、社会与治理ESG报告对企业问责重要,大模型和RAG有望自动提取关键绩效指标,但开源模型在该领域的表现仍不充分明确。本文以欧盟上市公司2010—2024年的498份真实ESG报告构建结构化框架和评估资源,使用覆盖ESG信息需求的100组基于角色的合成问答,评估七个2B—30B开源模型:glm-4.7-flash、nemotron-3-nano:4b、qwen3:4b-instruct、gemma3:4b、gemma4:e4b、gemma4:e2b及ministral-3:8b。系统以RAGAS的上下文召回、精确率、相关性、忠实性、答案相关性和事实正确性评估。架构间表现差异明显:检索指标普遍较强,上下文召回约0.58—0.61,精确率约0.78—0.81,相关性0.965—0.985;生成在忠实性上差异最大,为0.607—0.822,答案相关性差异最小,为0.760—0.881。glm-4.7-flash忠实性最高0.822,qwen3事实正确性最高0.449,ministral-3答案相关性最高0.881。整体事实正确性仅0.387—0.449,突显领域微调需求。本文为ESG报告中部署开源模型提供数据依据。