论文
评估交互式AI智能体的认知年龄对齐
Evaluating Cognitive Age Alignment in Interactive AI Agents
摘要
尽管智能体AI及其核心的多模态大语言模型(MLLM)在从日常生活到前沿科学研究等各领域的语言与视觉推理中展现出显著潜力,人工智能与人类智能之间仍存在深刻差距。尽管集成了强大工具与先进MLLM,最先进的AI智能体仍经常在儿童也能轻松解决的基础性、看似简单的任务上失败。受韦克斯勒儿童智力量表(WISC)启发,我们提出ChildAgentEval,首个以心理测量学为基础、用于评估基于MLLM的智能体认知年龄对齐的交互式基准。ChildAgentEval系统地将各类基于MLLM的交互式智能体的推理表现与特定年龄段的人类发展阶段进行对比,揭示当前智能体AI系统在哪些方面能够、在哪些方面无法模拟特定年龄段的认知行为。
