论文

Litmus (Re)Agent:多语言模型预测评估的基准和代理系统

Litmus (Re)Agent: A Benchmark and Agentic System for Predictive Evaluation of Multilingual Models

模型评测基准与评测资源

摘要

我们研究预测性多语言评估:在缺少直接基准结果的情况下,估计模型在目标语言任务上的执行情况。这个问题在多语言部署中很常见,其中评估覆盖范围很少,并且发布的证据在不同语言、任务和模型系列之间不均匀。我们引入了涵盖 6 个任务和 5 个证据场景的 1,500 个问题的受控基准。该基准将可访问的证据与 真值 分开,从而能够对必须从不完整的文献证据推断缺失结果的系统进行评估。我们还提出了 Litmus (Re)Agent,这是一个 DAG 编排的代理系统,可将查询分解为假设、检索证据并通过特征感知聚合来综合预测。在六个系统中,Litmus (Re)Agent 实现了最佳的整体性能,在直接证据薄弱或缺乏的传输密集场景中收益最大。这些结果表明,结构化代理推理是在不完整证据下进行多语言性能评估的一种有前途的方法。