论文
RespondeoQA:拉丁语-英语双语问答的基准
RespondeoQA: a Benchmark for Bilingual Latin-English Question Answering
摘要
我们引入了拉丁语和英语双语环境中问答和翻译的基准数据集,其中包含约 7,800 个问答对。这些问题取自拉丁语教学资源,包括考试、问答题以及 1800 年代至今的教科书。经过自动提取、清理和手动审核后,数据集涵盖了多种问题类型:基于知识和技能、多跳推理、约束翻译和混合语言对。据我们所知,这是第一个以拉丁语为中心的 QA 基准测试。作为案例研究,我们评估了三个 大语言模型(LLaMa 3、Qwen QwQ 和 OpenAI 的 o3-mini),发现它们在面向技能的问题上表现较差。尽管推理模型在扫描和文学设备任务上表现更好,但总体改进有限。 QwQ 在用拉丁语提出的问题上表现稍好,但 LLaMa3 和 o3-mini 更依赖于任务。该数据集为评估专门语言和文化领域的模型能力提供了新的资源,并且创建过程可以轻松适应其他语言。该数据集位于:https://github.com/slanglab/RespondeoQA