论文
带实时语音问答的排练式多智能体产品实时演示
Rehearsed Multi-Agent Live Product Demonstrations with Real-Time Voice Question Answering
摘要
实时产品演示是软件组织中反复发生的高成本活动:人类演示者必须选择功能、在运行中的应用上分发对应交互、连贯叙述并实时回答问题。既有自动化仅解决片段——通用浏览器智能体面向指令条件化任务完成,演示视频工具产出不可质疑的固定MP4。我们提出Rhetor:多智能体系统——以运行中的Web应用及其源码仓库为输入,产出带段同步叙述与实时语音问答的排练式实时演示。架构贡献:跨模态功能表示——将UI探索与源码分析合并为带离散焦点层级标签的功能;受约束的脚本编写器——限于探索期间观察到的UI元素、经多策略语义定位器分发;演示前排练循环——带显式收敛与优雅降级为纯叙述段;运行时同步不变量——把每个浏览器动作绑定到其叙述段的音频结束事件。跨四个部署应用的六次管线会话——含公开领域白板应用Excalidraw:排练器的内部定位器触发率σ̄跨147个脚本动作达0.31-1.00。