论文

语言条件token和大语言模型中的推理效率:配对跨语言学习协议

Language-Conditioned Token and Reasoning Efficiency in Large Language Models: A Paired Cross-Lingual Study Protocol

模型评测评测方法与指标

摘要

大语言模型会产生依赖于语言的表示和推理成本,但现有的比较经常将输入语言、分配的可观察跟踪语言和答案实现混为一谈。我们指定了一项前瞻性配对研究,该研究将这些接口分开,同时保持语义项检查点和答案预言的固定。初始设计实例化了从英语和七种非英语模板呈现的 240 个精确评分项目、三个不同谱系开放权重检查点、三个跟踪token预算、22 个输入和跟踪语言条件、一个固定答案储备和一个单独计数的分隔符:在预期样本大小选择之前进行 47,520 次初始核心运行。 RQ1-RQ3 通过包含故障的终端记账和测试答案实现的意图处理来估计输入和跟踪效果,方法是将密封前缀和运行时本机 KV 状态克隆到八个交叉分支中。预冻结的独立语言审查、固定形式的 ASCII 选择器和代码/表面/求解器协议限制了实现测试。 H1-H5 共享一个 Holm 系列和一个全球同步分量频段。二次随机实验比较了冷冻种子和预言机盲聚合下相同痕量的单长尝试和完整 K 短尝试策略;这是一个完整的策略对比,因为答案容量不同。结果包括精确的token跨度、正确性、延迟、运行时暴露的记忆以及合格的同一主机操作系统在预先指定的硬件导轨上报告的能量。该协议将分词器扩展、可观察跟踪成本和答案实现成本分开,而不将可见跟踪视为内部认知或将操作系统估计视为物理跨设备能量。没有报告验证性模型结果;结果字段保持禁用状态,直到冻结证据分类帐通过独立的验证。