论文

探索科学可视化中 LLM 代理的交互范式

Exploring Interaction Paradigms for LLM Agents in Scientific Visualization

智能体系统上下文与知识记忆智能体互操作协议Agent任务评测Agent记忆MCP

摘要

本文研究了不同类型的大语言模型 (LLM) 代理如何执行科学可视化 (SciVis) 任务,其中用户根据自然语言指令生成可视化工作流程。我们通过评估 15 个基准任务中的 8 个代表性代理并测量可视化质量、效率、稳健性和计算成本,比较了三种主要交互范例,包括具有结构化工具使用的特定领域代理、计算机使用代理和通用编码代理。我们进一步分析交互方式,包括用于结构化工具使用的代码脚本和模型上下文协议(MCP)或 API 调用,以及用于更一般交互的命令行界面(CLI)和图形用户界面(GUI),同时另外研究持久记忆在选定代理中的影响。结果揭示了范式和模式之间的明显权衡。通用编码代理可实现最高的任务成功率,但计算成本较高,而特定领域代理更高效、更稳定,但灵活性较差。使用计算机的代理在各个步骤上表现良好,但在较长的多步骤工作流程中表现不佳,这表明长期规划是它们的主要限制。在基于 CLI 和 GUI 的设置中,持久内存通过重复试验提高了性能,尽管其优势取决于底层交互模式和反馈质量。这些发现表明,没有一种方法是足够的,未来的 SciVis 系统应该结合结构化工具的使用、交互功能和自适应记忆机制,以平衡性能、鲁棒性和灵活性。

探索科学可视化中 LLM 代理的交互范式
图 1:SciVisAgentBench 中的 15 个代表性 ParaView 可视化任务。