论文

通过 VLM 驱动的结构化绘图表示生成语音同步白板

Speech-Synchronized Whiteboard Generation via VLM-Driven Structured Drawing Representations

应用与实践内容创作

摘要

创建白板式教育视频需要手绘插图和口头叙述之间的精确协调,但现有的方法还没有通过结构化、可复制的绘图表示来解决这种多模式同步问题。我们展示了第一个包含 24 个配对 Excalidraw 演示的数据集,其中每个绘图元素都带有跨越 8 个 STEM 领域的毫秒精度创建时间戳。利用这些数据,我们研究了通过 LoRA 微调的视觉语言模型 (Qwen2-VL-7B) 是否可以仅通过 24 个演示来预测与语音同步的完整笔画序列。我们的主题分层五重评估表明,时间戳调节显着改善了消融基线上的时间对齐,而模型则概括了未见过的 STEM 主题。我们讨论了向真实课堂环境的可转移性,并发布了我们的数据集和代码以支持自动化教育内容生成的未来研究。