论文
MCRI:分析和评估座席技能的四维框架
MCRI: A Four-Dimensional Framework for Analyzing and Evaluating Agent Skills
摘要
随着Agent从单一工具系统发展到模块化、复合架构,技能正在成为能力开发和分配的重要机制。然而,学术界缺乏系统分析和评估技能的结构化框架。利用信息增益和行为约束,我们提出了四维 MCRI 框架,并将其实施为 MCRI-Eval,一种基于大语言模型的评估方法。我们使用来自 OpenClaw 技能中心的 63,812 个公共技能以及 BigCodeBench、BFCL-Fundamental 和 Mind2Web 上的 58,275 个技能条件模型执行来评估 MCRI-Eval。 MCRI-Eval 分数与社区流行度信号正相关,并在评估方法中实现了最高的下游排名一致性。 MCRI-Eval 还改进了所有三个基准测试中的 top-1 技能选择:与每个基准测试中最强的基线相比,MCRI-Eval 选择的技能在 BigCodeBench、BFCL-Fundamental 和 Mind2Web 上的下游性能排名中分别提高了 17.7、22.8 和 19.6 个百分点。这些结果表明,MCRI-Eval 提供了有用的执行前信号,可以在昂贵的基于执行的评估之前优先考虑有前景的技能。