论文

UO-FIE:将精确标签监督与分级实用程序相结合进行事实推理

UO-FIE: Combining Exact-Label Supervision with Graded Utility for Factivity Inference

模型训练监督微调与指令调优

摘要

事实推理评估 2026 (FIE2026) 将中文情境假设对分为九个有序事实区间。其评估指标奖励准确的预测和接近正确区间的能力,而 566 个训练示例中的 64.1% 属于单个类别。在初步实验中,几个 mDeBERTa 分类模型主要预测主导类别,而 Huber 回归基线在正确区间附近产生更多预测,但精确匹配较少。我们引入了面向效用的事实推理(UO-FIE),这是一种将精确标签监督与分级效用相结合的参数高效系统。 UO-FIE 预测九个类别的分布,并结合硬标签监督、基于效用的软目标、预定类别权重和序数损失。我们在受控比较中评估预期效用解码,并使用针对提交的系统的折叠预测选择的序数校准。基于带有LoRA的Qwen3.5-9B,UO-FIE以0.8316的宏观效用在微调赛道上排名第一。一个单独的基于提示的集成在非微调轨道中排名第三,宏效用为 0.8450。