论文
System-1决策模型配对与自审计评测
Fast Models, Slow Evidence: A Paired and Self-Audited Evaluation of System-1 Decision Models for LLM Agent Harnesses
摘要
智能体Harness每个任务要做许多小的类型化决策:调用哪个模型、用哪个工具、检索文本是否相关、输入是否携带注入。System-1决策模型以单次前向传播输出类别概率回答此类问题,有望比LLM调用大幅节省成本与延迟。我们在由18个公开来源构建的11个智能体决策点上,对开源(Laya)与托管(Jev)两个System-1模型做配对评测:7283个基础用例加6640个鲁棒性变体,输入逐字节一致、配对检验并做跨硬件与跨日期复现检查。Jev在11个决策点中的9个上显著更准(+10.8至+46.0个百分点)。两模型在零样本模型路由上都不优于随机,在RAG相关性门控上打平。选项顺序颠倒时Laya会改变30%的答案;候选多而相似时急剧退化(50个最近邻工具下31%,而Jev在有唯一正确工具的题目上为98%)。我们还审计了自己的管道:三个分析错误和一个设计混淆曾扭曲头条部署结论——漏算的预筛成本(报告23.9%节省,实际4.3%)、把门控准确率当作端到端质量(58%对98%)、样本内阈值(目标5%,保留集最多漏检17%),以及一个随通道原生内容消失的"通道效应"注入误报。另有两个疑似混淆未改变结论。全部用例、原始输出与分析代码见 https://github.com/David-DL-Space/sys1-eval 。