论文

Padamitra:古典梵语的扎根词汇表生成

Padamitra: Grounded Glossary Generation for Classical Sanskrit

模型评测基准与评测资源

摘要

我们引入了扎根词汇表生成,这是一项结构化任务,要求模型恢复语义上有意义的梵语短语,并从 sloka-翻译对中生成基于翻译的含义,将传统的路径评论实践形式化为可评估的 NLP 目标。我们构建了来自《Valmiki Ramayana》和《Srimad Bhagavatam》的 31,316 个 sloka-translation-glossary 三元组的基准,并与两个指标配对:用于短语恢复的 Jaccard 和用于语义一致性的 Meaning 忠实性。在 Gemma-3n-E4B、Gemma-3-12B、Phi-4 和 Qwen3.5-9B 的零样本、少样本和指令微调变体中,指令 微调 的性能显着优于提示,而显式分段会产生增益。错误分析将连读和连读复合词的过度分割确定为主要的失败模式,指出形态建模是忠实梵文词汇分解的关键瓶颈。