论文

使用大语言模型自动生成经复杂度验证的决策场景

Automated Generation of Complexity-Validated Decision Scenarios Using Large Language Models

模型评测评测方法与指标

摘要

认知决策研究依赖复杂度受精细控制的多样化场景,但人工制作缓慢、不一致且有偏。我们开发了自动化流水线,用大语言模型生成结构化决策场景,并通过植根于既有任务复杂度理论的复合框架验证其复杂度。我们在多个领域与复杂度层级上评估了4,238个场景。测量验证达到严格的心理测量学标准。五个独立模型族间的一致性接近完美,组内相关系数为0.997,kappa为0.971。已知组效度显示层级间分离显著,eta方为0.587,所有两两比较在p小于.001水平显著。因子分析揭示出主导的复杂度构念,在三个框架上载荷介于0.87至0.96之间,而交互性构成较弱的次级维度(0.34)。区分效度受复杂度与文本长度间强关系的限制,该关系在控制层级后依然存在,偏相关为0.86。这限制了构念纯度,但并不损害该工具的层级分级功能。模型分析显示吞吐量与模式通过率负相关(r = -0.967, p = .007, n = 5),暗示速度-质量权衡,但主要由一个高吞吐模型驱动。Llama 4 Maverick生成场景最快,每分钟134个,而DeepSeek Chat V3.2为25个,但前者复杂层级的场景产出不足,后者则在领域覆盖与高模式合规间取得平衡。该系统展现出强心理测量学特性,能可靠地将场景分类为简单、中等与复杂层级,并为下游的AI系统认知评估提供所需的测量基础设施。

使用大语言模型自动生成经复杂度验证的决策场景:论文配图
图1:两阶段测量与分析框架。阶段1建立构念效度(H1a–H1e、H3);阶段2将经验证的测量工具应用于模型表现比较(H4–H6、RQ5–RQ6)。阶段2以阶段1为前提。