论文
OASIS:使用 大语言模型 的基于评分标准的多模式评估平台
OASIS: A Rubric-Based Multimodal Assessment Platform Using Large Language Models
摘要
OASIS(开放评估和评分基础设施堆栈)是一个系统平台,用于使用 大语言模型 对视频、音频和文本进行基于评分的评分。使用 LLM 对一件工件进行评分非常简单;大规模部署评估需要遭遇管理、标题版本控制、模态感知执行、来源捕获和人工审查。 OASIS 将独立的命令行界面与规范的集成 Elephant + MAPLES 堆栈配对,用于遭遇管理和多模式分级编排。这两种路径都可以通过 Ollama 和 OpenAI 兼容端点(例如 vLLM)以托管 API 或自托管开放权重模型为目标。 SimRubrics 标题创作和 Wayfinder 对话代理网关是可选扩展,它们使用与人工操作员相同的经过身份验证的界面。给定一个标题和记录的遭遇,OASIS 会生成每个标准的分数、证据和理由,并保留执行工件以供审计。独特的功能包括标题即程序编译、渐进式执行计划、内容可寻址的评分身份、转录增强的多模式评分、明确的审查状态以及人类和自主代理的共享命令界面。尽管是在医学教育中开发的,但该架构与领域无关,适用于可以根据记录或书面工件评估结构化性能的任何地方。自 2023 年秋季以来,该平台在 UT 西南医学中心投入使用,已处理了 7,000 多次就诊。本出版物包括报告和项目信息,不包括应用程序源、二进制文件、安装材料、示例数据或标记的软件版本。