论文
Jev独立评测:分类表现与概率阈值的任务差异
Evaluating and Benchmarking the System One Model Jev
摘要
作者用固定请求模板在37个数据集上评测Jev 1.13.0,并以相同输入对照Qwen3.8-27B和Gemma-4-E4B的候选词元概率。Jev在多数分类数据集上领先这两个对照模型;低资源语言、细粒度标签和按规则评分仍是较难任务。 选择题概率能支持筛选较有把握的答案,但二元判断的0.5阈值并不普遍适用。在UNFAIR-ToS任务中,依据训练数据调整阈值后,micro-F1由0.50提高到0.75。作者公开评测代码与原始响应,便于按具体任务核对分类质量和阈值效果。