论文

CLEF SimpleText:多候选LLM简化与堆叠幻觉检测

Writerslogic at the CLEF 2026 SimpleText Track: Multi-Candidate LLM Simplification and Stacked Complexity Spotting

模型评测基准与评测资源

摘要

我们介绍Writerslogic参加CLEF 2026 SimpleText共享任务的方法,涵盖任务1文本简化与任务2复杂性识别。任务1使用GPT-4o-mini,以不同温度为每句生成五个简化候选,再用无需参考的评分启发式选择,奖励压缩、源词保留、Cochrane通俗摘要词汇及词汇简单性。在任务1.1句级简化中,Claude Sonnet 4提交获得SARI 47.43、BLEU 14.21,为句级系统第一;任务1总榜第三,前两名为文档级提交。任务2将幻觉检测视为自然语言推断,在350K组标注的来源—句子对上微调DeBERTa-v3-large NLI模型。模型把最相关源句作为前提,候选作为假设,学习区分有依据和幻觉内容。任务2.1二分类过度生成识别中,文档级宏F1为0.8081,最佳集成为0.8085,识别赛道条目第一、团队总排第二,落后AIIR Lab的0.8197。任务2.2多类错误分类最佳准确率0.804,按独立团队排名第二,落后AIIR Lab的0.827。两项任务均在Cochrane系统综述的英语与多语医学文本上评估。