论文

小语言模型中可解释的跨语言对齐:日英双语中的文化和语用推理探索 LLM

Interpretable Cross-Lingual Alignment in Small Language Models: Probing Cultural and Pragmatic Reasoning in Japanese-English Bilingual LLMs

模型评测模型行为与机制分析

摘要

大语言模型 在英语上表现良好,但在类型上远离英语的语言上却表现得难以理解。日语就是一个明显的例子,其评估仍然依赖于翻译质量和 JGLUE 风格的基准,它将词汇、句法和语用能力综合为一个分数。通用模型在日本用户中失败的现象是实用主义的:敬语、群体内和群体外的参考、上下文相关的礼貌、零回指。我介绍了 J-PragEval-v0,这是一个最小对基准,将四种此类现象与表面流畅性隔离开来,并将其与线性探针和教师强制对数概率评估相结合,以询问 TinySwallow-1.5B(28 层,隐藏大小 1536)内部的相应对比情况。这四个功能分为三部分。敬语语域干净地位于残差流中:第 15 层的平衡准确度为 0.96,并且模型在 93% 的项目上翻转了其首选场景的延续。隐式主题和组内参考在最终提示标记(0.48 和 0.38)处不可线性解码,但翻转率为 0.77 和 0.79,因此对比度是在生成过程中计算出来的,而不是存储在提示处。间接拒绝是负面情况:在长度归一化的教师强迫下,0.95 的探测准确度下降到 0.43 的翻转率,因为当前的最小对将礼貌与延续长度混为一谈。我还指定了 Pragmatic Representation Steering,这是一种无参数推理时间方法,可沿探测识别的类均值差方向编辑残差流激活。可行性是间接争论的,而不是证明的:对比激活添加基线,该方法将注入相同的几何形状,在线性信号存在的地方恢复逻辑回归的一到两个点内的探测精度。下一步是扩展到 Llama-3.1-Swallow-8B。