论文

ProMoral-Bench:评估LLM道德推理与安全性的提示策略

ProMoral-Bench: Evaluating Prompting Strategies for Moral Reasoning and Safety in LLMs

模型评测基准与评测资源

摘要

提示设计显著影响大语言模型(LLM)的道德能力与安全对齐,但实证比较在不同数据集与模型之间仍然零散。我们提出 ProMoral-Bench,一个统一基准,在四个 LLM 家族上评估 11 种提示范式。使用 ETHICS、Scruples、WildJailbreak 以及我们新的稳健性测试 ETHICS-Contrast,我们通过所提出的统一道德安全分数(UMSS)衡量性能,这是一个平衡准确性与安全性的指标。我们的结果显示,紧凑的、由示例引导的支架优于复杂的多阶段推理,以更低的 token 成本提供更高的 UMSS 分数与更强的稳健性。多轮推理在扰动下被证明是脆弱的,而少样本示例则持续增强道德稳定性与抗越狱能力。ProMoral-Bench 为有原则、高性价比的提示工程建立了一个标准化框架。

ProMoral-Bench:评估LLM道德推理与安全性的提示策略
图1:UMSS 与 token 成本的对比。十一种提示策略的 UMSS 分数相对于每样本平均 token 数(对数刻度)的散点图。绿色阴影表示最优区域;点线标记效率阈值;虚线为 LSRL。