论文

用于复杂动态系统中反馈控制器设计的 大语言模型 的基准测试和推理 蒸馏

Benchmarking and Reasoning Distillation of Large Language Models for Feedback Controller Design in Complex Dynamical Systems

模型评测基准与评测资源

摘要

尽管 大语言模型 (LLM) 已在各个科学领域展示了卓越的功能,但反馈控制器设计仍未得到充分探索。现有基准测试主要关注线性单自由度 (DoF) 系统和大型 API 托管模型,复杂控制器设计任务的性能和边缘部署的可行性尚不清楚。为了解决这些限制,我们引入了 大语言模型 (CoDyControlBench) 的复杂动力学控制基准,包括跨五个评估维度的 132 个系统配置:自由度数量、系统类型、耦合水平、阻尼机制和控制器类型。六个最先进的 LLM 在三次独立运行中进行了评估,包括三个商业模型(GPT、Gemini 和 Claude)和三个开源模型(GLM、DeepSeek 和 Qwen)。 GPT 的设计成功率最高,为 94.8%,而 Qwen 的设计成功率最低,为 50.0%。在基准维度上,DoF 和控制器类型在设计成功方面表现出最大的模型平均变化,成功率范围分别为 36.3% 和 17.6%,超过了与系统类型、耦合水平和阻尼机制相关的成功率范围。 GPT 和 Qwen 的比较表明,它们的性能差距主要来自控制设计知识,特别是增益选择和瞬态限制机制的使用。对于边缘部署,通过推理 蒸馏 开发了专门的 1.5B 参数模型。推理蒸馏模型的性能优于 CoDyControlBench 上的答案蒸馏模型和基础模型,在 1-6 个自由度范围内保持稳定的性能,并在气动人工肌肉驱动的机械臂上的所有三个物理试验中成功实现了目标跟踪。这些结果建立了基准基线,并凸显了轻量级、可边缘部署的控制器设计模型的潜力。