论文
从描述性到规范性:揭示基于LLM的智能体的社会价值对齐
From Descriptive to Prescriptive: Uncover the Social Value Alignment of LLM-based Agents
摘要
基于LLM的智能体的广泛应用要求与人类社会价值观强力对齐。然而,现有工作在自我认知、困境决策以及自我情绪方面仍显不足。为弥补这一不足,我们提出一个新颖的基于价值的框架,利用GraphRAG将原则转化为基于价值的指令,并通过在特定对话上下文中检索合适的指令来引导智能体按预期行事。为评估预期行为的比例,我们基于两个著名理论——马斯洛需求层次理论与普拉奇克情绪轮——定义预期行为。通过在DAILYDILEMMAS基准上实验,与ECoT、Plan-and-Solve和Metacognitive prompting等基于提示的基线相比,我们的方法展现出显著的性能提升。我们的方法为AI系统中自我情绪的涌现提供了基础。
