论文

TriEval:面向LLM偏见、毒性与真实性的资源高效管线

TriEval: A Resource-Efficient Pipeline for LLM Bias, Toxicity, and Truthfulness Assessment

模型评测评测方法与指标

摘要

大语言模型已经从基本的聊天机器人发展成为人工智能生态系统的支柱,目前广泛应用于医疗保健、学校和政府服务领域。大语言模型在整个领域的采用需要持续评估,以确保其安全性和公平性。部署大语言模型后遇到的常见问题包括输出不一致和错误信息的幻觉。尽管存在许多 LLM 评估工具,但大多数工具仅限于一次测试单个参数,或者需要大多数研究人员无法访问的大量计算资源。 TriEval 通过评估多个参数(包括偏差、毒性和真实性)的 LLM 输出,同时最大限度地减少计算资源来应对这些挑战。该管道与开源和闭源模型兼容,并且在没有 GPU 集群的标准笔记本电脑上运行。 TriEval 已在四种型号上进行了测试:Llama 3 8B、Mistral 7B、Gemma 2 9B 和 Claude Haiku。结果显示开源模型和闭源模型之间存在明显差异,特别是在毒性和真实性方面。 TriEval 将作为开源发布,以便为计算资源有限的研究人员提供更广泛的访问权限。