论文

经伦理困境的LLM亚里士多德美德画像

Aristotelian Virtue Profiling of LLMs through Ethical Dilemmas

模型评测评测方法与指标

摘要

大语言模型(LLM)常面临伦理权衡——其中多种响应可能都可辩护但表达不同优先级——如公平、诚实、勇气或克制。我们介绍VirtueMap——经亚里士多德美德伦理视角描述这些模式的框架。VirtueMap不问单一正确答案——而是让人类或LLM对七个一般性、非致命、非政治、非宗教伦理困境的每个全部五个响应排序。为定义评分所用参照排序——我们首先为每个困境与每项美德提出五响应从最表达该美德到最不表达的排序——随后每排序收集超100名受访者评估——仅当至少95%确认时才保留为操作性真值。排名用归一化Borda对齐对照保留排序打分——产出实践智慧、正义、诚实、勇气与节制的画像。我们对九个LLM家族施加VirtueMap重复运行评估——发现高平均排名一致性(90.3%)——最大差异出现在勇气、节制与正义上。我们还发布在浏览器本地计算画像、比较受访者与实测LLM画像的交互网站。

经伦理困境的LLM亚里士多德美德画像:论文配图
图 1:VirtueMap 工作流程。困境和反应排名基于美德表达顺序的常识验证,然后使用标准化的博尔达对齐进行评分。重复的大语言模型运行评估模型概况和稳定性。分数按 0-100 计算;五边形图使用 40-100 视觉缩放只是为了便于阅读。