论文

人工智能可以像城市规划师一样进行推理吗?根据专业判断对 大语言模型 进行基准测试

Can AI Reason Like an Urban Planner? Benchmarking Large Language Models Against Professional Judgment

模型评测基准与评测资源

摘要

问题、研究策略和发现:大语言模型(LLM)的兴起提出了城市规划的一个关键问题:哪些形式的专业规划知识可以人工智能复制,哪些仍然需要人类判断?尽管人工智能工具越来越多地应用于规划实践,但仍然没有系统的框架来测试它们是否能够利用规划专业知识的情境敏感性、价值意识和机构素养进行推理。本文介绍了城市规划基准 (UPBench),这是一个特定领域的评估框架,通过改编自 Bloom 修订后的分类法的四个知识支柱和五个认知水平的 4x5 矩阵来评估 LLM 推理。通过自动评分和专家评审对 25 LLM 进行评估,我们发现了一条非单调的认知曲线:模型在高阶分析任务上的表现优于事实回忆和综合判断。这表明,通常被视为低阶的规划知识深受制度、管辖权和时间背景的影响,使得 LLM 难以概括。我们将这些限制总结为四种认知诊断:调节性幻觉、概念混淆、邪恶麻痹和语音缺陷。实践要点:研究结果支持规划中的差异化授权。 LLM可以协助跨学科综合、文献综述、情景生成和初步政策分析。然而,它们对于特定管辖区的监管、规范性冲突解决和上下文相关程序仍然不可靠。各机构应要求对人工智能辅助监管分析进行验证,而规划教育应强调机构素养、规范判断和情境敏感性。