论文

Jev独立评测:分类表现与概率阈值的任务差异

Evaluating and Benchmarking the System One Model Jev

模型评测模型推理判别式推理与决策模型能力评测Jev

摘要

作者用固定请求模板在37个数据集上评测Jev 1.13.0,并以相同输入对照Qwen3.8-27B和Gemma-4-E4B的候选词元概率。Jev在多数分类数据集上领先这两个对照模型;低资源语言、细粒度标签和按规则评分仍是较难任务。 选择题概率能支持筛选较有把握的答案,但二元判断的0.5阈值并不普遍适用。在UNFAIR-ToS任务中,依据训练数据调整阈值后,micro-F1由0.50提高到0.75。作者公开评测代码与原始响应,便于按具体任务核对分类质量和阈值效果。

Jev与开放模型的概率校准曲线。
Jev与开放模型的概率校准曲线。