论文
使用大语言模型自动生成经复杂度验证的决策场景
Automated Generation of Complexity-Validated Decision Scenarios Using Large Language Models
摘要
认知决策研究依赖复杂度受精细控制的多样化场景,但人工制作缓慢、不一致且有偏。我们开发了自动化流水线,用大语言模型生成结构化决策场景,并通过植根于既有任务复杂度理论的复合框架验证其复杂度。我们在多个领域与复杂度层级上评估了4,238个场景。测量验证达到严格的心理测量学标准。五个独立模型族间的一致性接近完美,组内相关系数为0.997,kappa为0.971。已知组效度显示层级间分离显著,eta方为0.587,所有两两比较在p小于.001水平显著。因子分析揭示出主导的复杂度构念,在三个框架上载荷介于0.87至0.96之间,而交互性构成较弱的次级维度(0.34)。区分效度受复杂度与文本长度间强关系的限制,该关系在控制层级后依然存在,偏相关为0.86。这限制了构念纯度,但并不损害该工具的层级分级功能。模型分析显示吞吐量与模式通过率负相关(r = -0.967, p = .007, n = 5),暗示速度-质量权衡,但主要由一个高吞吐模型驱动。Llama 4 Maverick生成场景最快,每分钟134个,而DeepSeek Chat V3.2为25个,但前者复杂层级的场景产出不足,后者则在领域覆盖与高模式合规间取得平衡。该系统展现出强心理测量学特性,能可靠地将场景分类为简单、中等与复杂层级,并为下游的AI系统认知评估提供所需的测量基础设施。
