论文
IREA:规范 RAG 的基于中间表示的嵌入对齐
IREA: Intermediate Representation-based Embedding Alignment for Normative RAG
摘要
大语言模型(LLM)在各种任务中都表现出了出色的表现,但他们仍然在涉及道德判断的问题上遇到困难。之前的研究曾尝试对LLM进行道德标准训练,但道德规范的多样性和相对性使其难以在模型参数中完全内化。作为替代方案,我们引入了规范 RAG,这是一种检索增强方法,支持使用外部规范知识进行道德判断。规范检索涉及上下文丰富的叙述性查询和广义规范性陈述之间的明显不对称。现有的事实检索方法依赖于仅查询扩展为类似文档的形式,这使得它们不足以解决这种不对称性。因此,我们提出了基于中间表示的嵌入对齐(IREA),这是一种双向对齐方法,可将两种文本类型映射为共享的情境行为表示。这种表示以标准化形式捕获道德上显着的上下文和行为信息,减少表面差异并改善嵌入空间的一致性。实验结果表明,IREA 改善了多种环境下的规范检索和下游伦理判断,证明了规范 RAG 双向对齐的有效性。
