论文

TCEval:用热舒适评估AI的认知与感知能力

TCEval: Using Thermal Comfort to Assess Cognitive and Perceptual Abilities of AI

模型评测评测方法与指标

摘要

LLM任务专用基准存在一个关键空白。热舒适是环境因素与个人感知的复杂交互,涉及感觉整合与自适应决策,是评估AI系统真实世界认知能力的理想范式。为此,我们提出TCEval,这是首个利用热舒适场景和大语言模型(LLM)智能体评估AI三项核心认知能力——跨模态推理、因果关联与自适应决策——的评估框架。方法包括:用虚拟人格属性初始化LLM智能体,引导其生成服装热阻选择和热舒适反馈,并对照ASHRAE全球数据库和中国热舒适数据库验证输出。在四个LLM上的实验显示,虽然智能体反馈与人类的精确一致有限,但在1 PMV容差下方向一致性显著改善。统计检验表明,LLM生成的PMV分布与人类数据差异显著,且智能体在离散热舒适分类中的表现接近随机。这些结果证实了TCEval作为生态有效的AI认知图灵测试的可行性,表明当前LLM具备基础的跨模态推理能力,但对热舒适变量间非线性关系缺乏精确的因果理解。TCEval是对传统基准的补充,把AI评估重心从抽象任务熟练度转向具身的、情境感知的感知与决策,为推动AI在智能建筑等以人为本的应用中发展提供了有价值的洞见。