论文
本地大模型机器翻译的提示范围与示例相似性评估
Evaluating Prompt Scope and Demonstration Similarity in Local LLM Machine Translation
摘要
大语言模型日益用于通用翻译,但评估通常仅要求把一句原文翻译为一种目标语言。实际请求也可能同时涉及多个相关语言,或提供翻译示例。论文将提示范围与示例选择作为本地大模型机器翻译的实验变量,在完整 FLORES devtest 上评估英语到九种欧盟罗曼语族与日耳曼语族语言的翻译。研究比较 llama3.2:3b、mistral:latest、qwen2.5:14b 三种本地指令模型与 OPUS-MT、NLLB-200 专用翻译基线,测试零样本和五示例提示,示例以随机、词汇相似性或嵌入相似性选择。同时比较单目标提示与用 JSON 格式一次请求同一语族所有语言的多目标提示。专用翻译系统总体最强,尤其在日耳曼语族上。少样本提示改善了 Mistral 和 Qwen,却降低了 Llama3.2:3b 的效果;嵌入检索对较强大模型平均最优,但相对随机和词汇示例的优势不大。语族多目标提示对较强本地模型可行,却暴露出较小模型的结构化输出失败。研究建议翻译评估同时考虑语言对、指标、提示范围、检索策略及多目标遵循程度。