论文
STAR:连接统计与Agentic推理的大模型性能预测
STAR : Bridging Statistical and Agentic Reasoning for Large Model Performance Prediction
摘要
随着对大模型的全面评估变得代价高昂,从有限观测预测模型性能已变得至关重要。然而,现有统计方法难以应对模式漂移与数据稀疏,且缺乏解释性,而纯LLM方法仍然不可靠。我们提出STAR,一个连接数据驱动统计预期(STatistical expectations)与知识驱动Agentic推理(Agentic Reasoning)的框架。STAR利用专用检索器收集外部知识,并将语义特征嵌入受约束概率矩阵分解(Constrained Probabilistic Matrix Factorization,CPMF),以生成带不确定性的统计预期。随后,一个由期望违背理论(Expectation Violation Theory,EVT)引导的推理模块通过同族内分析、跨模型比较与置信度感知聚合来细化预测,产生带有可追溯解释的调整。大量实验表明,STAR在基于分数与基于排名的指标上持续优于所有基线,在极端稀疏(每个测试模型仅1–2个观测分数)条件下,总分数较最强统计方法提升14.46%。
