论文
隔离还是打分?面向成本高效多智能体RAG的模型自适应评估
To Isolate or to Score? Model-Adaptive Assessment for Cost-Efficient Multi-Agent RAG
摘要
面向检索增强生成的多智能体文档评估计算昂贵——驱使从业者转向可部署的小模型——而其评估机制仍知之甚少。我们在多样QA基准上对7B-9B指令微调模型开展免训练干预的受控研究——揭示模型从评估中获益的急剧二分。对较弱基线——主导机制是逐文档隔离。令人惊讶的是——无评估的隔离匹敌完整多智能体评估——表明解决多文档上下文混淆而非打分质量驱动高达50个百分点的超额增益。相反——对打分质量要紧的较强基线——我们引入推理-分数耦合——无标签扰动探针——对打分行为分类。整合这些发现——我们提出MADARA——模型自适应路由架构。关键的是——MADARA从单个试点模型导出的诊断阈值零样本泛化到四个未见模型家族——提供消除计算开销的稳健轻量管线。
