论文

STAR:连接统计与Agentic推理的大模型性能预测

STAR : Bridging Statistical and Agentic Reasoning for Large Model Performance Prediction

模型评测评测方法与指标

摘要

随着对大模型的全面评估变得代价高昂,从有限观测预测模型性能已变得至关重要。然而,现有统计方法难以应对模式漂移与数据稀疏,且缺乏解释性,而纯LLM方法仍然不可靠。我们提出STAR,一个连接数据驱动统计预期(STatistical expectations)与知识驱动Agentic推理(Agentic Reasoning)的框架。STAR利用专用检索器收集外部知识,并将语义特征嵌入受约束概率矩阵分解(Constrained Probabilistic Matrix Factorization,CPMF),以生成带不确定性的统计预期。随后,一个由期望违背理论(Expectation Violation Theory,EVT)引导的推理模块通过同族内分析、跨模型比较与置信度感知聚合来细化预测,产生带有可追溯解释的调整。大量实验表明,STAR在基于分数与基于排名的指标上持续优于所有基线,在极端稀疏(每个测试模型仅1–2个观测分数)条件下,总分数较最强统计方法提升14.46%。

STAR:连接统计与Agentic推理的大模型性能预测
图2:STAR 框架概览。给定一个预测模型 M M 在基准 B B 上的性能的用户查询,STAR 集成四个模块:(a) Historical Memory 维护已观测的分数矩阵以及模型和基准的结构化档案;(b) Retrieval Augmentation 从 google、huggingface 和 arxiv 收集外部知识;(c) Statistical Expectation 将 PMF 潜在因子与检索语义特征结合,生成带有不确定性估计的初始期望;(d) EVT-guided Reasoning 通过两步分析和考虑可信度的聚合来细化预测,产生带有解释的调整量 Δ \Delta 。