论文

Dr-CiK:面向前瞻驱动智能体的测试床

Dr-CiK: A Testbed for Foresight-Driven Agents

智能体系统Agent任务评测

摘要

真实场景中的时间序列预测往往不仅取决于历史观测,还取决于必须从嘈杂、异构的信息源中主动发现的外部上下文。然而,现有的上下文辅助预测基准通常假定支撑性上下文已经提供,未回答智能体能否自行识别它。为此,我们提出Dr-CiK,一个评估智能体能否从文档语料库中检索与预测相关的支撑上下文、过滤干扰项、将检索到的上下文蒸馏为对预测有用的证据,并生成有该证据支撑的预测的基准。通过上下文消融以及对最先进深度研究与预测方法配对组合的评估,我们表明高质量上下文能显著提升Dr-CiK中的预测性能。然而,大多数现有DR智能体只能恢复一小部分真实支撑证据(通常<5%),经常被干扰项误导(干扰项引用率>80%),甚至会使预测器在有检索上下文时表现得比没有上下文时更差。我们的结果推动了对通过搜索正确上下文来预测未来的前瞻驱动智能体的研究。

Dr-CiK:面向前瞻驱动智能体的测试床:论文配图
图 1:通过深度研究进行情境辅助预测(CAF via DR)的概述。 (A) 该任务提供历史观察并要求未来轨迹,当未来值取决于未观察到的外部驱动因素时,仅靠历史可能是不够的。 (B) 给定观察到的序列和文档语料库,代理 1 接收输入,2 检索相关上下文,同时避免干扰,3 提取检索到的上下文并将其合成为预测有用的证据。 (C) 预测者根据综合证据来产生基于证据的预测,当外部驱动因素塑造未来时,这可能与仅历史预测有很大不同。