论文
模拟人工智能市场动态下的代理评估
Evaluation of Agents under Simulated AI Marketplace Dynamics
摘要
现代信息访问生态系统由多种系统组成,例如检索系统和 大语言模型,并且越来越依赖市场来协调对模型、工具和数据的访问,从而使系统之间的竞争成为部署所固有的。在这种情况下,结果不仅取决于基准质量,还取决于竞争压力,包括用户切换、路由决策和运营限制。然而,评估仍然主要在静态基准上进行,采用以准确性为中心的措施,假设系统是孤立运行的。这种不匹配使得很难预测部署后的成功,并掩盖了早期采用优势和市场主导地位等竞争效应。我们引入市场评估,这是一种基于模拟的范例,用于评估作为竞争市场参与者的信息访问系统。通过模拟重复的交互以及不断变化的用户和代理偏好,该框架可以实现纵向评估和市场级指标(例如保留率和市场份额),从而补充并超越传统的基于准确性的指标。我们在商业和经济的推动下,围绕市场模拟、指标、优化和 TREC 等评估活动的采用,正式确定了框架并概述了研究议程。