论文

VakyArth:评估 LLM 跨印度语言的语用能力

VakyArth: Evaluating Pragmatic Competence in LLMs across Indic Languages

模型评测基准与评测资源

摘要

现实世界的交流通常需要务实的推理:解释通过上下文和文化习俗隐含的含义,而不是字面意思。现有的语用评估仍然主要局限于英语和高资源语言,而印度语言尽管具有语言和文化多样性,但尚未得到探索。我们推出 VakyArth,这是印度语言的第一个实用基准,旨在作为涵盖印地语、旁遮普语、泰米尔语和马拉雅拉姆语的诊断评估。 VakyArth 评估五种现象的模型:指示、言语行为、含义、社会语用学和连贯性;通过多项选择题、自然语言推理和翻译,所有项目均由母语人士撰写。在不同语系和规模的多语言 大语言模型 (LLM) 中,我们发现植根于印度语言和文化习俗的语用意义始终存在缺陷。我们的分析显示了不同语言和任务之间的系统差异:在所有模型语言组合中,MCQ 准确性超过 NLI 准确性,翻译性能不能可靠地跟踪语用理解,印度-雅利安语言比德拉威语言显示出翻译优势。我们进一步表明,自动翻译指标可能会错过流畅但实用上不忠实的输出,特别是对于暗示和指示语。