论文
闭环:正式验证的法律作为自我改进法律人工智能的奖励信号
Closing the Loop: Formally Verified Law as a Reward Signal for Self-Improving Legal AI
摘要
本文开发了一种架构,可创建形式上可验证的奖励信号来训练法律人工智能,采用 LLM 的建议,验证者将数学人工智能的范式部署到法律的独特要求。我们提出了一种架构,包括 LLM 驱动的自动形式化到扩展 Catala 的形式法律演算、验证内核以及基于形式证明轨迹的解释生成。对于法律的计算组件,该架构提供了可证明的正确性。对于开放结构的法律分析,它提供了结构性保证:法律论证的每个必要阶段都得到解决,论证在正确的阶段进行而不被遗漏,步骤之间的演绎联系是有效的。我们展示了德国法律中的程序期限计算、美国宪法中的商务条款分析以及跨司法管辖区制裁比例的架构。我们进一步表明,相同的架构对于法律人工智能训练具有结构性优势:确定性外部验证者为法律问题提供可验证的结果,从而弥补了法律中传统强化学习循环的差距。