论文
FlashRT:用于指导代理部署实时多模式应用程序的代理工具
FlashRT: Agent Harness for Guiding Agents to Deploy Real-Time Multimodal Applications
摘要
实时多模式应用程序(包括语音代理和交互式视频生成)将异构模型组合成管道,其有效部署需要有关放置、流式传输和模型内并行性的特定于应用程序的决策。现有的服务系统和自动并行编译器致力于有限的转换和固定的工作负载假设,因此在新应用程序上实现高性能需要手工设计高效的实现。我们推出了 FlashRT,这是一种代理工具,可指导 编码智能体 将简单的开发人员编写的参考实现提升为优化的多 GPU 部署,从而灵活权衡延迟和吞吐量等目标指标。使用新的程序链范例,FlashRT 通过多通道转换过程引导通用 编码智能体,其中代理将引用转换为中间表示 (IR) 以捕获数据依赖性和持久状态范围,通过顺序解释器验证此 IR,并执行静态分析以识别候选转换。然后,代理在测量门控优化循环下迭代地实施、验证和基准测试每个候选者,以产生跨越不同硬件预算的有效部署。在视频世界模型和多模式 LLM 等各种应用中,FlashRT 将参考实现转换为高效部署,在 NVIDIA B200 GPU 上实现约 70 倍的延迟减少和 2.8 倍的吞吐量提高。在 AMD MI355X GPU 上,FlashRT 在降低峰值延迟的同时将峰值吞吐量提高至 3.6 倍,这表明代理驱动的优化在专家优化不太成熟的平台上具有更高的可扩展性。事实上,对于 Qwen3-Omni 文本到音频推理,与 AMD MI355X 上的专家 vLLM-Omni 实现相比,FlashRT 将响应延迟减少了 65%。