论文

指导大型语言模型遵循法律的文字或精神

Directing large language models to follow the letter or spirit of the law

模型训练监督微调与指令调优

摘要

法律精神和文字之间的区别是研究和日常生活的一个中心问题,也是人们对构建安全、智能机器日益关注的问题。这种区别是基于什么?我们如何开发遵循规则背后意图的机器?我们使用有针对性的适应,使大型语言模型优先考虑法律的精神或文字。通过最小的修改,我们的方法显着改变了大语言模型在不同措施、新颖的小插曲、现实场景和有影响力的法律案例方面的行为。对模型内部结构的分析揭示了一个具有三个可解释维度的低维空间,与法律概念几何形状的正式预先指定框架相匹配。这些发现表明了大语言模型的法律思想是如何组织和指导的。