论文

以四象限方法评测 Redpine Science

Leveraging a four-quadrant approach for evaluating Redpine Science

模型评测评测方法与指标

摘要

Redpine Science 为模型和智能体提供了访问各种同行评审文献的单一访问点,可直接通过模型上下文协议 (MCP) 和 API 进行查询。该报告从两个层面评估 Redpine Science:检索到的块的相关性,以及与网络搜索相比,模型访问 Redpine Science 时的答案。同时使用公共和专家验证的基准。公共基准是一种被广泛接受的测试模型开发的方法,并且在实验室之间具有可比性,但风险饱和和记忆。为了解决这个问题,我们用经过专家验证的问题集来补充它们。本报告总共提出了四项评估。在此处报告的公共答案质量基准 ScholarQABench SciFact 上,Redpine Science 的智能体正确回答了 94.4% 的主张,而没有检索的正确回答率为 87.6%。在经过专家验证的问题集上,Redpine Science 的智能体指出了所需声明的 80.1%,而智能体仅限于网络搜索,该比例为 70.2%。在 Redpine 持有的金论文公共检索基准的 668 个查询中,除去任何模型推理,Redpine Science 将 83.1% 的查询 (召回率@10) 的正确源论文置于前十名结果中,而基准创建者的这一比例为 79.3%。盲法专家相关性小组将 Redpine Science 的 精度@5 评为 75.2%,而 PubMed 搜索工具的评分为 39.8%。我们在 https://github.com/redpine-ai/benchmarks. 发布了经过专家验证的问题集和说明,以重现上面的每个标题结果