论文
预测Agent何时应该推理?面向可靠性路由的行为压力测试
When Should Forecasting Agents Reason? Behavioral Stress Tests for Reliability Routing
摘要
预测Agent日益结合语言模型推理、检索、集成与校准,但何时应信任每种行为仍不清楚。我们在ForecastBench风格的二元预测任务上研究这一问题,将检索、推理、服从市场先验或使用历史类比的选择视为可观测的Agent行为,而非隐藏的实现细节。我们的核心发现是,机制选择依赖于证据来源:结构化历史类比在某些数据生成过程中占优,而市场/群体风格与保守基线在其他情况下更好。我们提出ReliabilityRoute,一种利用可靠性特征(如历史覆盖度、市场先验可用性、来源先验锐度、证据强度、证据分歧与时程)来引导预测Agent行为的结构化干预。一个固定的2024年拟合规则在未硬编码来源名称决策的情况下即可紧密匹配人工分类法;而一个walk-forward自调整规则从先前已结算的版本重新拟合阈值,并在16个后续LLM版本上取得我们确定性系统中最优的平均Brier分数。收益是温和的,且历史/搜索基线仍然极具竞争力。因此,主要贡献是一个行为压力测试,表明更多推理并不总是更好:预测Agent应首先估计哪个证据源值得掌控,路由策略本身应在可审计的约束下自适应,可复现工件已在https URL公开。