论文
OpenSkillEval:自动审核 LLM 代理的开放技能生态系统
OpenSkillEval: Automatically Auditing the Open Skill Ecosystem for LLM Agents
摘要
技能,即为 大语言模型 (LLM) 提炼的结构化工作流程指令,正在成为提高代理在实际下游任务中的性能的日益重要的机制。然而,随着开源技能生态系统的迅速扩展,不同模型和代理框架如何与技能交互、如何评估技能质量以及用户在实际性价比权衡下应如何选择技能仍不清楚。在本文中,我们提出了 \textsc{OpenSkillEval},这是一个针对技能增强代理系统和技能本身的自动评估框架。 \textsc{OpenSkillEval} 不依赖静态基准,而是自动从五类下游应用程序中不断发展的现实世界工件中构建现实任务实例:演示文稿生成、前端网页设计、海报生成、数据可视化和报告生成。它进一步收集和组织社区贡献的技能,以便在统一的任务设置下进行受控比较。使用 600 多个动态生成的任务实例和 30 种开源技能,我们对最先进的模型和代理框架进行系统评估。我们的结果表明,技能可用性并不能保证有效的技能使用,技能增强的好处在很大程度上取决于底层模型和代理框架,并且许多公开流行的技能并不总是优于没有技能的基础代理。这些发现强调了动态、基于任务的评估的必要性,并为 LLM 代理的技能设计、选择和部署提供了实用的见解。其他案例和基准测试资源可在项目网站上找到:https://yingjiahao14.github.io/OpenSkillEval-Web/。