论文
通过可执行代码工作流程对实时问答进行基准测试
Benchmarking Real-Time Question Answering via Executable Code Workflows
摘要
检索实时信息是现实应用中搜索集成代理的一项基本功能。然而,现有的基准主要是静态的,因此无法捕捉信息的时间动态和现实世界知识的不断发展的性质。为了解决这个限制,我们提出了 RT-QA,这是一种动态评估框架,它利用可执行代码工作流程在评估时检索最新答案。具体来说,我们构建了一个代理驱动的管道,自动生成用于网络爬行和基于 DOM 的答案提取的代码,以生成实时 真值。为了确保随着时间的推移进行稳健的评估,该管道进一步纳入了自我修复机制,以适应网页结构的变化。 RT-QA 涵盖 12 个领域(例如金融、体育),共有 320 个中文问题,分为三个难度级别。对最先进模型(例如 GPT-5.2、GLM-4.7)的广泛评估揭示了实时适应性的重大局限性:即使是最好的模型也只能达到 46% 的准确度。我们的分析强调了两种主要的失败模式:(1) 惰性检索,代理依赖搜索片段而不是深度扫描特定网站来获取信息(20% 的失败); (2) 时间混乱,这是一种认知错误,智能体检索历史日期(例如 2024 年的事件),但无法重新锚定到当前时间(2026 年)以进行后续推理。这些发现表明,未来的智能体不仅需要更好的检索策略,还需要强大的时间状态管理。