论文

长期仿真暴露AI伴侣的认知发展风险

Long-Term Simulation Exposes Cognitive-Developmental Risks in AI Companions

模型评测安全与风险评测

摘要

由大语言模型驱动的AI伴侣日益与认知发展中的用户(包括儿童与青少年)交互——产生可能随时间累积的风险。既有安全评估大多依赖单轮或短会话测试——无法捕捉仅经长期交互才涌现的风险。为填补该缺口——我们提出TSJ(剧场-舞台-裁判)——纵向框架——组合人设驱动的用户仿真、动态心理状态更新与回溯评估。我们跨四个发展阶段、二十四个风险维度与三个心理脆弱人设评估六个主流模型——覆盖12,960个仿真人日交互。TSJ表明短程测试系统性低估发展风险——TSJ仅在长期仿真关系的140轮后才给出稳定风险估计。应用TSJ进一步识别儿童早期与成年初显期为最脆弱阶段——认知信任与情感依赖为最弱域。TSJ为AI伴侣系统的纵向认知发展风险评估提供可扩展方法学。

长期仿真暴露AI伴侣的认知发展风险:论文配图
图 1:a,儿童与人工智能纵向互动过程中发育风险积累的说明性示例。 b,TSJ 框架概述。 c,纵向保留曲线,显示在 30 个模拟天内累积平均安全评分保持在或高于第 1 天基线的试验的比例。 d,按模型和心理脆弱性角色划分的平均最终安全得分(0-4;较高=更安全)。