论文
CAFE:复合人工智能因子评估框架
CAFE: A Compound-AI Factorial Evaluation Framework
摘要
我们介绍 CAFE(复合人工智能因子评估),这是一个开源平台,可将实验设计引入复合人工智能系统 (CAIS) 的评估中。此类系统提供了许多可互换的选择 - 例如检索器、模型或提示 - 从业者很少知道其中哪一个对答案质量影响最大。借助 CAFE,从业者将管道的每个可交换组件注册为一个因素,以针对所选因素构建因子设计,运行生成的配置,并使用可配置的 LLM 法官与人类评分者一起在共享评分标准上对答案进行评分。根据这些评级,它将答案质量差异归因于组件及其与混合效应模型的相互作用,并报告效应大小、重要性、最佳配置、成本和延迟权衡以及判断人类的可靠性。虽然现有工具大多要么搜索良好的配置,要么单独对输出进行评分,而 CAFE 还解释了哪个组件驱动质量以及观察到的差异是否显着。我们在 HotpotQA 基准数据集上的检索增强问答 (QA) 管道上验证 CAFE,其中它恢复了植入因子的影响并在排列零下保持校准。 CAFE 作为 Python 包和 Web 应用程序发布。