论文

面向自治网络中优化驱动意图处理的视觉语言模型

Vision Language Models for Optimization-Driven Intent Processing in Autonomous Networks

模型评测智能体系统智能体互操作协议基准与评测资源MCP

摘要

意图驱动网络(IBN)允许运营商指定高层网络目标而非底层配置。尽管近期工作表明大语言模型可以自动化配置任务,但有一类独特的意图需要生成优化代码,以计算流量工程、路由与资源分配的可证明最优解。当前系统假设基于文本的意图表达,要求运营商用文字逐一列举拓扑与参数。网络从业者天然通过图示来推理结构,但视觉语言模型(VLM)能否把标注过的网络草图处理成正确的优化代码仍未被探索。我们提出 IntentOpt,一个包含 17 个类别共 85 个优化问题的基准,在多模态与纯文本两种输入、三种提示策略下评估四个 VLM(GPT-5-Mini、Claude-Haiku-4.5、Gemini-2.5-Flash、Llama-3.2-11B-Vision)。评估显示,视觉参数提取使执行成功率下降 12-21 个百分点,其中 GPT-5-Mini 从 93% 降至 72%。程序化思维提示使性能最多下降 13 个百分点,开源模型落后于闭源模型,Llama-3.2-11B-Vision 仅达 18%,而 GPT-5-Mini 为 75%。这些结果确立了当前 VLM 在 IBN 系统中生成优化代码的基线能力与局限。我们还通过一个使用 Model Context Protocol 把 VLM 生成代码部署到网络测试床的案例研究展示了实际可行性。

面向自治网络中优化驱动意图处理的视觉语言模型
图1:IntentOpt 构建与评估的六阶段流程。阶段1至4构建基准,阶段5和6使用不同的提示策略评估 VLM。