论文

通过构建基准教授 AI:QuestBench 作为负责任知识工作的课程实践

Teaching AI Through Benchmark Construction: QuestBench as a Course-Based Practice for Accountable Knowledge Work

智能体系统Agent任务评测

摘要

随着 AI 融入日常学习,许多课程主要教学生把 AI 当作生产力工具来使用:如何提示、搜索、总结、写作、编程以及更高效地使用工具。我们认为,AI 教育还需要一种情境,让学生学习如何测试 AI,并理解自己在评判机器生成知识中的角色。为此,我们引入一种基于课程的实践,通过构建基准来教授 AI,并以深度研究系统作为 AI 时代知识工作的具体范例。学生把学科知识转化为可验证的专家级问题,互相评审问题设计中的歧义与捷径,并在所得任务上评估 AI 系统。这一活动让学生直接接触强大的工具,同时要求他们明确一个可信答案需要具备什么条件。产出的基准 QuestBench 包含横跨 14 个人文与社会科学领域的 256 道问题。在 QuestBench 上的评估表明,学生设计的任务揭示出当前深度研究系统的隐性失败:在 13 个被评估系统中,题目级平均通过率仅 16.85%,表现最好的 GPT-5.5 通过率为 57.58%。这些失败在教育上有价值,因为它们展示了流畅、有出处支撑的回答仍可能在查询、来源、术语或证据标准上出错。五位学生参与者的反思表明,构建基准能帮助学生认识到,专业知识不仅是 AI 可检索的内容,更是评判 AI 输出的依据。我们既把 QuestBench 作为基准成果呈现,也把它视为一个可复用的课堂情境,服务于一个更大的教育问题:当 AI 进入学习与职业工作,学生如何继续做负责任的知识行动者。数据集发布于 https://huggingface.co/datasets/PKUAIWeb/QuestBench/tree/main。

通过构建基准教授 AI:QuestBench 作为负责任知识工作的课程实践:论文配图
图 1:QuestBench 的概念框架,作为基于课程的基准构建,用于教授负责任的人工智能介导的知识工作。学生首先接触深度研究系统作为实用工具,然后使用基准构建来设计专家级问题、测试捷径、验证答案、评估模型和分析失败。该课程将工具暴露与问题设计、纪律标准以及评判人工智能作品的责任联系起来。