论文
预测工作流程基准:使用预算预测工具评估语言模型决策
Forecast Workflow Bench: Evaluating Language-Model Decisions with Budgeted Forecast Tools
摘要
时间序列基础模型 (TSFM) 为运营决策提供预测,但仅凭准确性并不能决定其价值。评估使用这些模型的代理需要衡量决策质量和预测成本。 FWBench 使用固定预测工具和模拟容量合同在 1,251 个电力和自行车租赁案例中评估了这种能力。代理选择模型、历史和视野,然后提交最小化既定损失成本目标的能力。我们评估了两种托管配置和八种本地配置,包括小语言模型,并测试了带或不带 TSFM 的本地模型。 GPT-6 Astra 使用 2.5% 的预算有选择地购买了廉价的短期预测,并且当使用三个损失成本权重对保存的决策进行评分时,其表现优于固定策略。 FWBench 能够对语言模型如何选择和使用时间序列预测在成本约束下做出决策进行可重复的评估。