论文
系统动力学AI助手基准评测:云端与本地LLM在CLD提取与讨论上的对比
Benchmarking System Dynamics AI Assistants: Cloud Versus Local LLMs on CLD Extraction and Discussion
摘要
我们对大语言模型家族——既涵盖专有云API,也涵盖本地托管的开源模型——在两个专为系统动力学AI辅助构建的基准上进行了系统评估:CLD Leaderboard(53项测试,结构化因果回路图提取)和Discussion Leaderboard(交互式模型讨论、反馈解释与建模辅导)。在CLD提取上,云模型达到77--89%的总体通过率;最好的本地模型达到77%(Kimi K2.5 GGUF Q3,零样本引擎),与中等水平的云模型相当。在Discussion上,最好的本地模型在建模步骤上达到50--100%,在反馈解释上达到47--75%,但在错误修复上仅0--50%——该类别以长上下文提示为主,暴露出本地部署的内存限制。本文的一个核心贡献是对性能的模型类型效应的系统性分析:我们在相同的底层模型家族上比较推理型与指令微调架构、GGUF(llama.cpp)与MLX(mlx_lm)后端,以及量化级别(Q3 / Q4_K_M / MLX-3bit / MLX-4bit / MLX-6bit)。我们发现,后端选择比量化级别具有更大的实际影响:mlx_lm不强制JSON schema约束,需要在提示层面显式给出JSON指令,而llama.cpp的语法约束采样能可靠处理JSON,但会导致稠密模型在长上下文提示上无限生成。我们记录了所有本地模型的完整参数扫描(t、p、k)、清理后的计时数据(剔除卡住的请求),以及在Apple Silicon上运行671B--123B参数模型的从业者指南。