开源项目

IndexTeam公开SandGlass音节约束翻译评测工具,采用MIT许可

Sandglass: Syllable-Controlled Translation Benchmark

模型评测应用与实践基准与评测资源评测方法与指标机器翻译

概述

SandGlass是IndexTeam在10月4日公开的音节约束翻译评测工具,用于检查视频字幕译文能否在给定时长内兼顾长度控制与翻译质量。其MIT许可、prepare_inputs.py、evaluate.py及运行指南已分别核验,不将其他组件许可套用到本工具。数据包含300条中文字幕、四种目标语言和三种长度目标,共3600项任务。使用者先安装依赖和取得数据,按prepare_inputs.py输出的messages提交到自己的翻译系统,再按case_id保存最终译文。评分脚本分别计算音节偏差与LLM Judge质量,并报告不同长度目标间的控制效果;完整评测需要配置Judge端点和凭据,skip-judge仅做离线音节检查。模型输入不得包含参考答案或评分元数据;缺失预测按固定全量分母计零,重复或未知ID被拒绝,Judge服务错误不能当成模型成绩。应记录模型版本、生成设置与Judge配置。本次只把SandGlass软件组件计入开源工程;同批MEME/instTrans的非商业许可和NAtIveLong的语料及依赖条件留关联材料,不整组宣称可自由复用。