论文

逐字阅读法律问题:2144 个越南法律头条的嵌入轨迹

Reading a Legal Question Word by Word: Embedding Trajectories of 2,144 Vietnamese Legal Headlines

模型评测模型行为与机制分析

摘要

密集的 检索器 将问题编码为一个向量,但问题一次到达一个单词。我们使用 Nemotron-3-Embed 8B/1B 和 Qwen3-Embedding 8B/0.6B 逐字阅读了 Thu Vien Phap Luat(越南法律图书馆)中的 2,144 个保留标题,对 20,034 篇文章编码了 65,444 个前缀,加上来自 1,112 个多问题标题的 3,438 个子问题的每个前缀和168 个答案。 (i) 在读取疑问帧之前,在每个编码器中达到 6-7 个内容词的中位数之后,标准相关文章将成为排名 1,并且在 78-85% 的情况下保持该水平直到最后。 (ii) 在多问题标题中,94-98% 的情况下锁位于第一个子问题内;第二叶排名不变,为89-95%;单独编码时,在相同的锁字(95-97% 相同)下,第二个以 42-58% 的比例达到排名 1,而第一个为 91-96%。 (iii) 数字、日期和工具标识符将嵌入移动到实词的两倍、疑问词的四倍; 72-78% 的步骤朝着标准相关文章的方向发展,而 95-99% 的头条新闻的结尾疑问句则与这个方向相反。 (iv) 排名/余弦聚类产生六种原型(即时、典型、不稳定、延迟、永不锁定),这些原型因法律领域和形式而异(卡方 p < 1e-8):房地产和诉讼头条新闻从不锁定数字;环境和会计头条新闻中有三分之一的时间都是这样。 (v) 逐字阅读的答案会在 8-16 个单词后检索其文章,并在 83-89% 的情况下按提出的顺序解决子问题。 (vi) 单词的步长在整个标题中保持一致的方向(余弦 0.25-0.33;数字为 0.44-0.60);前面的问题将该步骤旋转约 60 度,将问候语旋转约 30 度;步骤随着 i^{-0.8} 缩小;两个问题的标题与其两个问题的线性组合的夹角在 12-17 度之内。我们称之为上下文调制的加法行走。