论文
LLM 的人权基准测试:试点方法
Toward Human Rights Benchmarking for LLMs: A Pilot Methodology
摘要
大语言模型 (LLM) 越来越多地调解关于实现什么人权以及如何实现人权的法律决定。然而,没有评估基准来评估他们是否能够正确推理人权法。为此,我们报告了我们为创建HumRightsBench而开发的强大且可扩展的方法所做的努力:第一个经过专家验证、基于场景的基准,用于评估基于国际人权法义务结构的推理。我们采用 IRAC 法律推理框架,以更好地适应人权工作的独特推理模式(用 P(“提出补救措施”)代替 C(“法律结论”,产生 IRAP)来构建我们的评估启发式。我们还制作了一系列真实情景试点,旨在涉及现实世界人权问题的多个方面,并由世界各地的人权律师和专业人士进行注释。最终,我们发现模型准确性分数在法律推理任务中变化很大(整体模型性能范围从 0.339 到 0.577,任务最小-最大范围从 0.025 到 0.774),这强烈表明 HumRightsBench 是在人工智能评估科学发展的关键时刻推进这一新兴子领域的有力工具。