论文

大语言模型能否帮助理解ROS2软件架构?

Can Large Language Models Assist the Comprehension of ROS2 Software Architectures?

模型评测模型能力评测

摘要

语境。最常用的机器人软件开发框架是 ROS2。 ROS2 架构非常复杂,有数千个组件以分散的方式进行通信。目标。我们的目标是评估 LLM 如何帮助理解有关 ROS2 系统架构的事实信息。方法。我们进行了一项对照实验,其中我们向 9 个 LLM 管理 1,230 个提示,其中包含有关 3 个尺寸增量的 ROS2 系统的架构相关问题。我们提供了一种通用算法,可以系统地生成 ROS2 系统的架构相关问题。然后,我们 (i) 对照通过运行和监控 3 个 ROS2 系统建立的 真值 来评估 LLM 答案的准确性,以及 (ii) 定性分析 LLM 提供的解释。结果。在所有 LLM 中,几乎所有问题都得到正确回答(平均值 = 98.22%)。 gemini-2.5-pro 表现最好(在所有提示和系统中均为 100% 准确率),其次是 o3 (99.77%) 和 Gemini-2.5-flash (99.72%);性能最差的 LLM 是 gpt-4.1 (95%)。只有 300/1,230 个提示被错误回答,其中 249 个与最复杂的系统有关。 LLM 的解释中的一致性分数范围从“服务引用”的 0.394 到“通信路径”的 0.762。不同模型的平均困惑度差异很大,chatgpt-4o 得分最低(19.6),o4-mini 得分最高(103.6)。结论。使用 LLM 来帮助 ROS2 开发人员理解其系统软件架构的重要方面具有巨大的潜力。尽管如此,开发人员应该意识到 LLM 的内在限制和不同性能,并在使用时考虑到这些。