论文
调教大语言模型:领域自适应、精准且安全
Tutoring Large Language Models to be Domain-adaptive, Precise and Safe
摘要
本论文提出一个“负责任智能”框架,以应对 AI 在安全、伦理和文化敏感性方面的关键挑战。它推进了三个核心方向:第一,利用主动学习和基于图的知识改进专业领域的领域适配,减少幻觉;第二,通过一种新颖的解码期对齐机制增强伦理严谨性,实时主动阻止有害文本生成;第三,通过尊重不同语言和社会规范的语言特定引导,保障文化与多语言安全。这项工作为构建具备情境知识、伦理健全且文化适应的下一代 AI 提供了蓝图。
