论文
超越排行榜:Agentic 小语言模型集成的词元经济学
Beyond Leaderboards: Tokenomics of Agentic Small Language Model Ensembles
摘要
随着大语言模型 (LLM) 从独立助手转变为 Agentic 工作流程,评估必须超越标量排行榜准确性,以考虑操作可靠性、成本、延迟和词元效率。我们使用 Agentic 小语言模型 (SLM) 集成以及 SLM 评审介导的反馈循环作为此类超越排行榜评估的案例研究。在 541 条提示的 IFEval 基准上,最好的集成实现了 97.34% 的严格提示准确率,超过最强的独立 LLM 基线 gpt-5.4 5.81 个百分点,同时在较低成本制度下运行。然后,我们分析这种增益背后的词元经济学和操作行为,包括每个样本的成本、词元组成、有用输出良好输出、反馈环恢复、延迟分解以及跨指令类别和约束计数的性能。我们的结果表明,Agentic SLM 集成可以用额外的测试时间词元和编排开销来换取改进的指令遵循保真度,从而激发未来 Agentic AI 系统的多维评估协议。