论文

MERCI 卡:高风险领域的LLM评估和部署框架

MERCI Cards: An LLM Evaluation and Deployment Framework for High-Stakes Domains

模型评测评测方法与指标

摘要

随着LLM越来越多地部署在高风险的专业工作流程中,工程师和研究人员需要有原则的协议来系统地跟踪、监控和提高整个部署周期的模型性能。我们提出了一个用于迭代LLM评估和部署的数学框架,并演示了其在刑事司法人工智能系统中的应用。我们的框架通过加权多目标优化,在模型选择、标题设计、评估和部署等高风险、高风险和资源受限的领域中正式实现LLM集成。我们证明 MERCI 卡可以指导系统在部署迭代中的改进,将开发人员的注意力引导到表现不佳的区域,并将用户的注意力集中在LLM输出中的验证和纠错上。