论文

LLM 对于语法工程有多大用处?粤语语法资源和以英语为基线的对照实验评估

How Useful are LLMs for Grammar Engineering? Cantonese ParGram Resources and Controlled Experimental Evaluation with English Baselines

模型评测模型能力评测

摘要

本文介绍了新的粤语 ParGram 资源,并在受控实验范式内评估了 LLM 的知识驱动语法工程。使用粤语 ParGram 资源作为金标准,并以相应的英语基线为基础,我们研究了 OpenAI 的 gpt-oss-120b 和 GPT-5.4 是否可以在系统变化的提示条件下从句子生成机器可处理的语法并针对形式结构。 GPT-5.4 的性能优于 gpt-oss-120b,而从目标形式结构生成的语法通常优于从句子生成的语法。尽管这两个模型都可以生成局部合理的短语结构规则、词汇条目和模板,但它们经常难以协调交互的形式约束,尤其是在多结构设置中。结果描述了当前 LLM 的能力和局限性,以潜在地集成到人工智能辅助的专家工作流程中:LLM 可能支持语法开发的中间阶段,但人类语言专业知识仍然是分析、验证和细化的核心。该研究还贡献了新的粤语符号语法资源。