论文

VisInteract:面向不完美查询的动态交互式文本到可视化

VisInteract: Towards Dynamic Interactive Text-to-Visualization under Imperfect Queries

智能体系统Agent 规划

摘要

现实中的可视化请求常存在模糊、不完整或事实错误的情况,但现有文本到可视化的系统假设输入明确且一次性生成图表。当查询不准确时,系统需与用户交互以恢复真实意图,但目前尚无基准或方法支持这一动态过程。我们提出VisInteract,一种将文本到可视化重新定义为以交互驱动意图恢复的新范式,并提出VisInteract-Bench,据我们所知,这是首个用于动态交互式文本到可视化的基准,具备受控的不完美注入、可控泄露的用户智能体以支持真实多轮反馈,以及代码与图表双视角的自动化评估。在算法层面,我们提出Vis-MCTS,一种基于蒙特卡洛树搜索(MCTS)的增强方法,引入了三种改进:渐进扩展以控制树搜索中工具参数空间的无界性,跨轨迹展开的信息共享使澄清与批评惠及整个搜索树,以及维度感知奖励分解,将标量用户反馈沿数据准确性、可视化设计和意图对齐三个维度分配,以解决异构操作间的信用分配问题。在两个大语言模型基础架构上的广泛实验表明,Vis-MCTS在各项指标上均优于所有文本到可视化的基线方法,相较于最强的交互式基线,端到端任务成功率提升13.40%至16.27%,相比非交互式方法提升超过5倍。

VisInteract:面向不完美查询的动态交互式文本到可视化:论文配图
图1:文本生成可视化范式比较。(a)明确查询对应单一目标图表。(b)模糊查询可有多种解释,既有方法使用静态映射或预设反馈。(c)VisInteract通过动态、多轮、多模态交互,从不完善查询中恢复用户意图。