高风险人工智能的确定性决策。具有 RAG 的可部署性和机器学习的准确性的零出口管道
Deterministic Decisions for High-Stakes AI. A Zero-Egress Pipeline with the Deployability of RAG and the Accuracy of Machine Learning
摘要
我们将干预偏差视为零样本大语言模型(LLM)教育咨询代理的一种先前未量化的失败模式:在没有针对特定任务的训练的情况下,当事后最佳预言机政策要求不采取行动时,他们会建议采取行动。在开放大学学习分析数据集的六臂消融中(N = 800 名学生,四个时间截止点),在第 56 天时——当预言机指定 70.1% 的学生不需要干预时——零样本 GPT-4o 建议 73% 的学生采取行动,即 43 个百分点的假阳性率。商业 RAG 和 SQL 增强检索的校准相对错误;对于 10,000 名学生,这意味着每个周期大约有 4,300 次不必要的顾问联系。监督策略学习消除了这种偏差:轨迹条件 ONNX Decision Transformer (DT) 和快照 XGBoost 分类器在严格的仅前缀特征下在相同的预言机标记轨迹上进行训练,两者都实现了接近于零的校准误差。 DT 在所有五个动作类别中均达到了宏 F1 0.79(宏召回 0.85),甚至能够以 0% 的动作翻转率和低于 5 毫秒的 CPU 决策延迟来预测罕见的负载减少动作而不会崩溃。两个受监管的部门处于同等水平; DT 在最终截止时相对于 XGBoost 的优势仅具有指示性(在队列中未配对)。范围:我们在结构化 OULAD 数据的受控预言输入下验证第 2 阶段决策(EAV 状态向量到监督策略);高保真度反映了特征预言机的一致性,而不是一般的高风险人工智能能力。最有力的发现是干预偏差对比,而不是绝对准确性。我们还显示了评估差距:LLM 作为法官评分(DeepEval G-Eval)对干预偏差视而不见,奖励流畅的过度处方而不是决策质量。