模型

Index-Translate翻译模型家族新增官方GGUF、FP8与NVFP4量化权重

Index-Translate official quantized builds

模型推理AI 基础设施推理加速模型部署

概述

IndexTeam在10月3日发布官方量化模型权重,覆盖Index-Translate、Homura、NativeLong及Echo的已发布模型变体,权重同时提供Hugging Face与ModelScope入口。GGUF面向llama.cpp本地推理,FP8为W8A8 compressed-tensors、用于vLLM,FP4为面向Blackwell的NVFP4 W4A4。语音Echo的GGUF只包含文本LLM骨干,FP8/FP4则提供带量化LLM的完整流水线,不能把它们当相同可用功能。部署者应核对实际模型标识、硬件与框架版本,以及多模态组件是否齐全。本条是9月30日模型发布之后的模型量化版本更新,不另造同名模型首发;35B-A3B仍保留preview身份。官方News的10月3日与量化仓库10月2日UTC晚间提交换算后的北京时间一致。