论文
CreateScore:可审计的简历筛查LLM级联路由
CreateScore: Domain-Theory-Informed Bayesian Routing for LLM-Based CV Screening
摘要
LLM可以支持基于评分规范的简历筛查,但对每个候选和标准都使用高能力模型成本较高。我们提出CreateScore,一个由领域理论引导的贝叶斯网络,用于标准级LLM路由。人工指定的有向无环图使用Dirichlet—多项式条件概率表,将简历证据转为后验不确定性;低不确定性判项由本地8B模型处理,其他升级至120B参考模型。图的设计受因果动机启发,但系统做的是标准贝叶斯条件推断,并非因果推断。升级阈值在训练折上校准,目标为70%本地处理,之后冻结。在200份合成数据科学简历上,包含139名训练和61名测试候选、五项标准,77.7%的判项由本地模型完成,即305项中的237项。相比全部交给120B参考模型,路由减少65.2%的token用量,精确评分一致率从单独8B的32.8%升至42.6%,95%置信区间为31.0%—55.1%;n=61时该增益无法在统计上区分。但不确定性信号未识别8B出错的判项:升级项与本地项相对参考的分歧率分别为16.2%和19.4%,AUROC为0.47,95%置信区间0.39—0.56,不优于随机选择。我们还记录了一次早期评估如何因截断推理输出被静默替换成本地标签而失效,并建议级联评测防护。证据支持CreateScore作为可审计的降本机制,尚不支持其为针对性错误检测器,也不是自主招聘系统。