论文

RFCLLM:评估大语言模型的网络协议状态机推理能力

RFCLLM: Evaluating LLMs' Reasoning Ability of Network Protocol State Machines

模型评测模型能力评测

摘要

将文本规范映射到形式表示对于确保协议设计和实现的正确性至关重要。 LLM 生成的映射用于网络安全或测试,假定可以完美理解规范,但这在实践中可能不成立。本文的目的是评估大语言模型能够正确解释规范的程度。我们检查大语言模型通过自然语言描述定义的有限状态转换系统的隐式表示与手动生成的真实模型的一致程度。我们为 16 个协议设计了 4 个任务和 1482 个任务查询。我们评估了不同的判断偏差,观察了任务之间固有的难度差距,研究了 4 种上下文类型的影响以及协议特征的影响。我们的工作有助于验证 LLM 在协议规范的 FSM(有限状态机)推理中是否真正可信。