论文

测量和减轻多语言刑事法庭中 LLM 的过度对齐

Measuring & Mitigating Over-Alignment for LLMs in Multilingual Criminal Law Courts

模型评测安全与风险评测

摘要

虽然 LLM 在法律领域的更广泛适用性目前由于其可靠性和任何错误的严重性而存在争议,但已经出现了易于理解和减轻风险的狭隘用途。值得注意的是,瑞士联邦最高法院使用小型本地模型进行四种官方语言的试探性翻译和短文摘要。然而,这种用法在刑法背景下具有挑战性。由于员工日常处理的裁决和案件可能包含暴力和性犯罪的详细描述,因此他们的合法工作会因激活模型护栏(过度对齐)而受到拒绝和免责声明的影响。为了衡量这种现象,我们引入了 TF-RefusalBench,这是一种源自瑞士最高法院公开裁决的刑法翻译和摘要的多语言基准。 TF-RefusalBench 总共包含 5,200 个法语、德语、意大利语和英语提示,对应于常见任务提示和可能触发拒绝的段落。然后,我们使用 TF-RefusalBench 来证明过度对齐是一种多方面的现象,受到模型以及正在处理的提示和文本语言的影响,并且考虑到免责声明对任务 忠实性 的影响,不能仅从过度拒绝的角度评估其影响。最后,我们评估了为刑法任务启用本地 LLM 的方法,证明虽然提示可能有效,但消除(拒绝指示消除)可以消除拒绝,同时对任务绩效的影响最小。