论文

隔离还是打分?面向成本高效多智能体RAG的模型自适应评估

To Isolate or to Score? Model-Adaptive Assessment for Cost-Efficient Multi-Agent RAG

上下文与知识检索增强

摘要

面向检索增强生成的多智能体文档评估计算昂贵——驱使从业者转向可部署的小模型——而其评估机制仍知之甚少。我们在多样QA基准上对7B-9B指令微调模型开展免训练干预的受控研究——揭示模型从评估中获益的急剧二分。对较弱基线——主导机制是逐文档隔离。令人惊讶的是——无评估的隔离匹敌完整多智能体评估——表明解决多文档上下文混淆而非打分质量驱动高达50个百分点的超额增益。相反——对打分质量要紧的较强基线——我们引入推理-分数耦合——无标签扰动探针——对打分行为分类。整合这些发现——我们提出MADARA——模型自适应路由架构。关键的是——MADARA从单个试点模型导出的诊断阈值零样本泛化到四个未见模型家族——提供消除计算开销的稳健轻量管线。

隔离还是打分?面向成本高效多智能体RAG的模型自适应评估:论文配图
图 1:MADARA 模型自适应路由架构。 (左)一次性 RSC 探针评估目标 LLM 的上下文容量 (EMNF\text{EM}_{\text{NF}}) 和评分行为 (ρ*,ρ^1\rho^{*},\hat{\rho}_{1})。 (中)路由器识别能力相变:弱基线模型被严格路由以绕过多文档评估。 (右)PDE(隔离)在结构上分离文档以消除上下文混乱,而仅评分处理(SDA、CoT、ATF)则细化强模型的文档评估。附录 E 中提供了完整的伪代码。