论文

IntElicit:经对话策略优化引出与评估情境化创造力

IntElicit: Eliciting and Assessing Contextualized Creativity via Dialogue Policy Optimization

模型训练强化学习

摘要

情境化评估为评估创造力提供了很高的生态有效性,但也带来了一个严峻的挑战:观察到的表现可能会与认知能力(领域知识)和能动性(参与意愿)相混淆。与此同时,在生成式人工智能时代,创造性问题的解决越来越多地发生在以工具为媒介和人与人工智能交互的环境中,这使得完全静态的评估不太符合当代的创造性实践。为了解决这些问题,本文提出了 IntElicit,一个通过对话政策优化来引发和评估情境化创造力的框架。 IntElicit 充当受约束的自适应 AI 访谈者:它在多轮交互中提供非指导性知识和机构支架,以减少非创意混杂因素,同时保留参与者生成正在评估的创意内容的责任。具体来说,为了解决开放式教育对话中的稀疏奖励和潜在的奖励黑客行为(例如,回答听写),IntElicit 引入了分解的过程奖励机制。这种机制使政策与教学启发相一致,奖励提示,吸引参与者推理,而不是代表他们产生最佳答案。广泛的实验,包括参与者模拟和人类受试者研究 (N=64),表明 IntElicit 比专家设计的基线提高了引发的创造性成果。总之,结果表明,交互式启发可以揭示静态 FPSP 式评估可能错过的创造性潜力,为人工智能介导的学习环境中的情境化创造力评估提供形成和诊断的视角。

IntElicit:经对话策略优化引出与评估情境化创造力:论文配图
图 1:研究动机和所提出的 IntElicit 框架的概述。 (a) 生态有效性差距:静态创造力评估可能会错过情境化问题解决任务中动态的、面向过程的推理。 (b) 交互式启发范式:人工智能面试官提供自适应支架(例如知识支持和机构启发),以减少评估过程中的非创造性混淆因素,同时保留参与者产生想法的责任。 (c) IntElicit架构:该框架结合了多维创造力指标、分解的过程奖励和多样化的参与者模拟器,以支持开放式对话政策优化。