论文
IndicTalk:基于角色的大规模印度语多语言会话语料库
IndicTalk: A Large-Scale Persona-Based Multilingual Conversational Corpus for Indic Languages
摘要
大语言模型 (LLM) 已经改变了对话式人工智能,但高质量的多语言混合代码对话资源仍然稀缺,特别是对于印度语来说,使用者自然地以母语和罗马字母形式在英语和母语之间交替。我们推出的 IndicTalk 是最大的多语言印度语代码混合对话语料库之一,包含超过 13,28,604 个基于事件的多轮对话,涵盖 18 种语言,涵盖 9 种印度语言。该语料库是通过完全自动化的管道生成的,该管道结合了现实世界的新闻基础、使用多语言 LLM 生成角色条件对话以及自动质量验证。广泛的语言、自动和人类评估表明,IndicTalk 可以在两种脚本变体中产生流畅、连贯且自然的代码混合对话。我们将发布 IndicTalk,以支持针对代表性不足的印度语言的多语言对话 AI 的开发和评估。该数据集位于:https://huggingface.co/datasets/LingoIITGN/IndicTalk。