论文
Benchmark Radar:持续更新的AI评测数据库与搜索引擎
Benchmark Radar: A Living Database and Search Engine for AI Benchmarks and Evaluation
摘要
基准研究者及LLM等AI系统开发者需要发现适合的评估、定位数据和代码,并理解分数背后的设置。Benchmark Radar是持续更新的数据库和搜索引擎,覆盖LLM、Agent工具使用、代码、推理、安全及领域评估。系统将每日论文、仓库、数据集和发布发现,与可搜索目录、模型卡及技术报告引用和分数历史结合,保留来源身份和引用以供核对。每日发现使用37个来源,包括13个直接连接器和24个一手研究工程信息流。目录含来自四个基准目录的1283条来源记录,其中790条有12916个数值观察。我们说明采集与检索方法,审计全目录,并分析饱和度、采用趋势及分数比较的局限;还演示完整既有工作搜索过程。发布内容包括网页仪表板、排行榜、分数与实测使用量的帕累托视图、饱和及趋势视图、每日信息流、可下载证据、离线查询CLI与可复现分析。