论文

模拟、记录、验证:基于肌肉的发音 QA 的语言可移植框架(扩展版)

Simulate, record, verify: A language-portable framework for muscle-grounded articulatory QA (extended version)

模型训练合成数据

摘要

发音数据描述了舌头的样子,但几何学本身并不能解释肌肉水平背后的配置或如何将其移动到目标姿势。我们提出了一个基于模拟器的框架,该框架通过受控的生物力学输入构建这种监督。每个模拟配置及其生成的肌肉状态和几何属性都存储在结构化事实记录中。标准答案是在语言实现之前得出的,并且每个自然化输出都会根据其源记录进行检查,因此相同的记录支持新的语言和问题类型,而无需重新模拟。我们使用 ArtiSynth Badin 舌头模型将框架实例化为 3DTongueQA。从 295,115 个网格中,我们为每种语言构建了 891,156 个经过记录检查的 QA 实例,检查器检测到超过 96.9% 的注入损坏。韩语和西班牙语的实现以及新的问题类型是从相同的记录中添加的,从而确认了可移植性。 SpiralNet++-Qwen3 探针达到 62.9 的肌肉 EM,在给定相同网格的情况下,最近邻传输高于 44.0,零样本商业 LLM 达到 7.2,而网格改组将其降至接近零。这种监督是可学习的,除了检索之外也很有用,并且以配对几何为基础。它反映了模拟器定义的状态而不是测量的生理学。代码、模板和 QA 集可在 https://github.com/esh0504/muscle-grounded-qa 上获取。