论文

TypedBench:联合评测结构化决策概率、措辞与成本

TypedBench: A Benchmark for Calibration, Framing Sensitivity, and Cost in System One Decision Models

模型评测模型推理判别式推理与决策评测方法与指标

摘要

系统一通过非生成接口对输入答案(例如分类选择、序数水平或二元结果)进行建模输出校准概率。软件可以通过阈值、成本加权选择和升级规则对这些概率采取行动。因此,如果这些概率校准错误或对措辞敏感,软件可能会采取意想不到的操作,使操作员无法检查文本依据。目前的评估主要报告公共分类数据集的准确性和校准,没有明确的参考。我们推出了 TypedBench,这是一种类型化决策模型的基准,例如 Jev,它是由七个策略标记生成器和九个评估套件构建的。我们将准确性报告为中值和跨释义范围,以及相对于匹配的、完美校准的预测器的有限样本本底噪声的校准误差。我们通过选择性预测、有序适当评分规则以及非对称成本矩阵下的实现成本来评估概率质量。我们评估托管模型、开放编码器和一系列开放解码器 相同项目的参数跨越 0.8B-9B。托管模式遵循既定政策,但措辞敏感且系统性不够自信;在不对称成本下,使用其概率可能比采用其最佳答案更糟糕。解码器的路由准确,并且随着选项或问题的添加而变慢。解码器在政策问题上最不准确,并且随着选项的增多而降级。总体而言,类型化决策模型必须在政策遵循性、措辞鲁棒性、概率质量和诱导决策结果方面进行联合评估。