论文
经伦理困境的LLM亚里士多德美德画像
Aristotelian Virtue Profiling of LLMs through Ethical Dilemmas
摘要
大语言模型(LLM)常面临伦理权衡——其中多种响应可能都可辩护但表达不同优先级——如公平、诚实、勇气或克制。我们介绍VirtueMap——经亚里士多德美德伦理视角描述这些模式的框架。VirtueMap不问单一正确答案——而是让人类或LLM对七个一般性、非致命、非政治、非宗教伦理困境的每个全部五个响应排序。为定义评分所用参照排序——我们首先为每个困境与每项美德提出五响应从最表达该美德到最不表达的排序——随后每排序收集超100名受访者评估——仅当至少95%确认时才保留为操作性真值。排名用归一化Borda对齐对照保留排序打分——产出实践智慧、正义、诚实、勇气与节制的画像。我们对九个LLM家族施加VirtueMap重复运行评估——发现高平均排名一致性(90.3%)——最大差异出现在勇气、节制与正义上。我们还发布在浏览器本地计算画像、比较受访者与实测LLM画像的交互网站。
