论文
针对自动决策门的经过训练的分类器和语言模型对 System One 决策模型进行基准测试
Benchmarking System One decision models against trained classifiers and language models for automated decision gates
摘要
将分支决策交给模型的软件需要明确选项,以及可用于阈值判断的概率。类型化决策模型,也称为系统一模型,在不生成文本的情况下返回此类概率,而监督分类器和生成语言模型是已建立的替代方案。在匹配条件下,一个Harness会发送来自六个系列的八个决策模型检查点(包括托管模型 Jev)和两个生成比较器相同的语义请求,并在相同的工作流程、意图和社会科学项目上对监督分类器和零样本分类器进行评分。模型类别的排名取决于条件。借助任务自己的标签,经过训练的小型分类器在意图上是最准确的,并且与工作流上的最佳决策模型没有显着差异。如果没有标签,除了基于编码器的检查点之外的每个决策模型都超过了工作流和意图上的零样本蕴涵分类器。通过选项标识的似然读取,更大的生成模型在工作流程和意图上与 Jev 持平,并以 5% 的风险接受更多工作流程决策,并且经过微调的决策检查点在其未调整的主干上获得了意图准确性。在少量选项上拟合并保存的温度参数,会在选项较多时增加校准误差,并且 5% 的范围内风险的保留阈值仍然让 Jev 接受 0.310 的范围外请求。对于 Jev,交换“是”和“否”翻转每 100 个答案有 50.5 个,而微调的检查点则减少了骨干的社会科学翻转。先使用在意图任务上训练的模型、必要时交由Jev处理的级联系统,在GPU充分利用时达到与Jev相当的准确率,成本为其0.43倍。结果产生了自动决策门的条件相关设计规则。