论文
G-IdiomAlign:跨语言习语对齐的 Gloss-Pivoted 基准
G-IdiomAlign: A Gloss-Pivoted Benchmark for Cross-Lingual Idiom Alignment
摘要
由于习语的非组合性和表面形式基础薄弱,因此难以跨语言迁移,使得字面映射不可靠。我们推出了 G-IdiomAlign,这是一个以注释为中心的基准,其中每个习语都以维基词典中的英语注释为基础。我们进一步构建了一个高置信度的参考比对集,用于可重复的评估。 G-IdiomAlign 支持两种协议:(1) 受控的多项选择习语等价,带有用于错误归因的类型干扰项; (2) 光泽对比生成,对比无光泽和有光泽输入,以隔离显式语义枢轴的影响。在不同的 LLM 中,对直译的偏见是主要的失败模式,特别是当目标是低资源语言时。在基于嵌入的语义代理下,光泽度持续改进光泽对比生成,但性能仍然不高,这表明开放输出空间有很大的空间。随后对 Qwen3-8B 的分析进一步表明,交叉条件差异更多地集中在注意力头而不是层中,而更好的 With-gloss 生成与更强的光泽锚定相一致。