论文

TalkFa:波斯语对话生成和理解的统一基准

TalkFa: A Unified Benchmark for Farsi Dialogue Generation and Understanding

模型评测基准与评测资源

摘要

波斯语有超过 1.2 亿人使用,缺乏对话生成和理解的全面基准。我们引入 TALKFA,一个由三个互补数据集组成的统一基准:(1)WIKI-FADIAL,4.2K 基于维基百科的对话,用于基于知识的生成; (2)DAILYDIALOG-FA,6.6K对白对话,标注对话行为和情感; (3) PLAYDIAL-FA,带有情感标签的 2.1K 戏剧对话。 LLM在协助数据构建的同时,每一个对话都经过波斯语母语人士的多阶段审核和修改,只有经过人工认可的最终对话才会发布。六个 LLAMA 和 MISTRAL 模型的实验表明,LoRA 显着改善了对话生成,同时仅需要 25-50% 的训练数据即可恢复超过 90% 的最终性能增益。在分类任务中,FABERT 实现了最佳的对话行为性能,LORA-MISTRAL-7B 在情感识别方面表现最佳,MISTRAL-24B 实现了最高的情感得分。人类评估和独立的外部验证证明了基准的可靠性,而作为 LLM 法官与 GPT-4.1 的比较表明,自动指标大大高估了对话质量。使用前沿 LLM 进行的零样本评估进一步表明 TalkFa 仍然是一个具有挑战性的基准。我们将发布所有数据集、注释指南、代码和检查点。