论文
万花筒项目:面向真实AI应用的情境化、人类对齐评估
Project Kaleidoscope: Contextual, Human-Aligned Evaluation for Real-World AI Applications
摘要
评估(Evals)是真实AI应用的部署瓶颈:公开基准很少匹配团队的用户、上下文或策略,人工评审又难以规模化。受我们在公共部门AI应用上的工作启发,本项目解决应用必须满足本地策略与治理要求时反复出现的评估挑战。我们呈现Kaleidoscope:一个情境化功能评估的集成工作流——链接人格驱动的测试生成、情境化量规与用于可靠性门控自动评分的人工评审。生成的测试用例对照应用专属量规打分;人工标注提供可评审的标签;LLM裁判仅在其与这些标签的一致性达到配置阈值时自动化打分。因此Kaleidoscope是面向产品团队的实用、可检查、可迭代的工作流。我们报告来自四个组织用例的三周试点早期证据,以及跨四域14个评估维度的108个标注问答对上的自定义量规裁判实验。结果凸显端到端可靠自动评分的有用特性。
