论文

从描述性到规范性:揭示基于LLM的智能体的社会价值对齐

From Descriptive to Prescriptive: Uncover the Social Value Alignment of LLM-based Agents

上下文与知识检索增强

摘要

基于LLM的智能体的广泛应用要求与人类社会价值观强力对齐。然而,现有工作在自我认知、困境决策以及自我情绪方面仍显不足。为弥补这一不足,我们提出一个新颖的基于价值的框架,利用GraphRAG将原则转化为基于价值的指令,并通过在特定对话上下文中检索合适的指令来引导智能体按预期行事。为评估预期行为的比例,我们基于两个著名理论——马斯洛需求层次理论与普拉奇克情绪轮——定义预期行为。通过在DAILYDILEMMAS基准上实验,与ECoT、Plan-and-Solve和Metacognitive prompting等基于提示的基线相比,我们的方法展现出显著的性能提升。我们的方法为AI系统中自我情绪的涌现提供了基础。

从描述性到规范性:揭示基于LLM的智能体的社会价值对齐:论文配图
图 1:SoVA 采用 GraphRAG 以二元选择问题 (BCQ) 的形式在日常困境测试台中与人类社会价值观保持一致。 GraphRAG 根据三种理论描述的预期行为进行调整:马斯洛的需求层次理论、普拉奇克的情感之轮和亚里士多德的美德。这种行为模式被转移到开放式对话中。