论文
向更好搜索迭代:评估智能体搜索的双智能体仿真框架
Iterating Toward Better Search: A Two-Agent Simulation Framework for Evaluating Agentic Search Architectures in E-Commerce
摘要
我们提出了一个模块化的二代理模拟框架,用于评估对话式购物助理架构。一个独立的买家代理,配置有角色、任务和耐心级别,并与一个可互换的响应器配对,该响应器与真正的电子商务搜索 API 集成。在实验中保持购买者不变,可以在相同场景下对响应者设计进行受控比较。利用 2011 年跨 14 个角色类别的对话,我们得出了四项实证结果。首先,滚动窗口内存在所有质量指标上都优于意图提取内存,同时每次查询速度提高了 35%。其次,展示了证据驱动的快速迭代,对响应者版本的系统故障分析可以实现有针对性的修复,从而将整个数据集的故障率和接近故障率降低 62%。第三,尽管架构相同,但将响应者 LLM 主干从 Gemini~2.5 交换到 Llama~3.3~70B 需要 0.16--0.45 点。最后,我们记录了前沿大语言模型法官之间系统性的哲学分歧:双子座奖励过程的正确性,而克劳德则要求具体的结果,尽管使用相同的评估提示。