论文
框架、评判、引导:面向教学AI的可评估能力模型
Framing, Judging, Steering: An Assessable Competency Model for Teach-ing Students to Reason With Generative AI
摘要
生成式人工智能使答案变得简单但难以理解,不加批判的使用会导致认知负担。学校仍然衡量独立的表现,但真正的任务是利用人工智能产生良好的工作:制定一个不明确的任务,判断输出,并引导模型取得更好的结果。这种能力很少被单独评估。在测量时,它会分解为一个“提示”分数,无法诊断人工智能使用成功或失败的原因。我们提出了 CoRe-3(协同推理),这是一种能力模型,将高效的人工智能使用分解为三种可评估的技能,我们缩写为 FJS:框架(在调用人工智能之前指定一个不明确的任务)、判断(评估错误和未陈述假设的输出)和指导(迭代地重定向模型)。其独特的主张是将前代框架与后代指导分开,并以判断作为两者之间的大门。我们以理论为基础,提出五个可测试的命题,并在 CoReasoningLab 中实例化它们,CoReasoningLab 是一个开放平台,可以呈现有缺陷的人工智能输出并对其进行独立评分。在模拟学习者(由不同模型生成和评分)中,技能是分离的:每个技能都跟踪自己的操纵能力,而其他技能保持不变,并且当一种能力在来自两个提供商的评分者后端的所有三个(收敛和判别效度)之间共享时,成绩就会变得相关。接下来是人工评估者的协议和结果;我们发布仪器、数据和协议。