论文
ProMoral-Bench:评估LLM道德推理与安全性的提示策略
ProMoral-Bench: Evaluating Prompting Strategies for Moral Reasoning and Safety in LLMs
摘要
提示设计显著影响大语言模型(LLM)的道德能力与安全对齐,但实证比较在不同数据集与模型之间仍然零散。我们提出 ProMoral-Bench,一个统一基准,在四个 LLM 家族上评估 11 种提示范式。使用 ETHICS、Scruples、WildJailbreak 以及我们新的稳健性测试 ETHICS-Contrast,我们通过所提出的统一道德安全分数(UMSS)衡量性能,这是一个平衡准确性与安全性的指标。我们的结果显示,紧凑的、由示例引导的支架优于复杂的多阶段推理,以更低的 token 成本提供更高的 UMSS 分数与更强的稳健性。多轮推理在扰动下被证明是脆弱的,而少样本示例则持续增强道德稳定性与抗越狱能力。ProMoral-Bench 为有原则、高性价比的提示工程建立了一个标准化框架。
