论文
人机协同假设检验:成本感知的选择性AI评分与顺序人工升级
Human-AI-Powered Hypothesis Testing: Cost-Aware Selective AI Scoring and Sequential Human Escalation
摘要
大语言模型越来越多地被用作廉价的裁判来评估输出、标注数据、判断系统是否达到期望的质量标准。然而,将AI判断用于正式的统计推断,与简单地把它们当作真实标签有本质不同:AI评估可能有偏或含噪,而严格的假设检验要求对第一类与第二类错误进行显式控制。我们研究如何以最低成本使用AI判断并结合选择性人工验证来执行有效的假设检验。我们考虑一个具有隐藏二元标签的条目总体。在选定固定的条目池后,决策者可以选择性地查询AI、将某条目直接送交人工、在观察AI报告后将AI评分的条目升级给人工,或在证据充分积累后停止。我们推导出一个信息论下界,刻画达到规定检验误差的最小成本,并通过一个依赖报告的信息边界刻画AI信息与人工验证的价值。受该刻画启发,我们提出SCALE,一个将选择性AI评分与自适应人工升级相结合的顺序成本感知策略。SCALE在有限样本下有效,且当目标错误概率趋于零时一阶匹配该下界。我们进一步利用配对的AI-人工试点数据将该框架扩展到未知的AI输出模型。数值实验显示,当某一来源明显占优时,SCALE接近纯人工或纯AI检验;而当廉价的AI判断与选择性人工验证都有价值时,SCALE实现最大节省。