论文

RegDivergence-101:检测生命科学跨司法辖区监管冲突的大语言模型基准

RegDivergence-101: An LLM Benchmark for Cross-Jurisdiction Regulatory Contradiction Detection in Life Sciences

模型评测基准与评测资源

摘要

为美国和欧盟开发药物的制药赞助商必须协调 FDA 和 EMA 独立发布的指南。如果两个机构要求实质相同,则担保人可以提交一次;如果存在分歧,单一试验设计可能会在一个地区遭到拒绝;如果一个机构在另一机构监管的某一点上保持沉默,则主办方必须推断其义务。如今,这种对账是由监管事务专家手动执行的。我们引入了跨司法管辖区监管分歧检测:给定 FDA 要求和 EMA 对同一主题的要求,将它们的关系分类为同意、分歧或沉默。 SILENT 本质上是有方向性的(SILENT_FDA 与 SILENT_EMA);我们记录每对的方向并在折叠标签旁边报告每个方向的 F1。我们发布了 RegDivergence-101,这是一个基于 101 对专家的试点评估基准(标签基于三项同行评审的 FDA/EMA 比较研究和主要 FDA/EMA/ICH 指导文本;双注释间注释器 kappa = 0.85),并系统地表征了四种方法的基线层次结构:词汇启发式(0.511 宏 F1,95% CI) [0.411-0.605])、NLI 交叉编码器(0.233)、义务级 Graph-RAG(0.663 [0.570-0.747])和平面 LLM 法官 / Claude Haiku(0.830 [0.747-0.908])。在试点规模(n = 101)中出现了三个方向性观察结果:SILENT 在语义上是可检测的,但对于仅包含蕴涵的表述来说是不可见的;配对级义务图比词汇方法有所改进,但跟踪平坦的 LLM 上下文(CI 部分重叠);语料库级图构建是大规模静默检测的指定架构目标。 RegDivergence-101 是一个试点版本,建立了任务制定和基线层次结构;第 7 节描述了四个未代表性的监管领域和扩展路线图。