论文
财报问答的词元预算升级:成本可预测,收益难排序
Token-Budgeted Escalation for Financial Document QA: Cost Is Predictable, Benefit Is the Bottleneck
摘要
检索增强生成系统可以将困难的查询路由到更深层的上下文,但批量部署必须在成本因查询而异的调用之间分配共享的 token 预算。我们将选择性升级制定为财务文档问答的有限批次分配。 150 个 FinanceBench 问题中的每一个首先都会收到一个 top-1 检索答案。预测器估计可选的前 5 名调用的裁决质量增益和 token 成本,分配器根据每个 token 的预测增益对调用进行优先级排序。在名义上 10% 的预算下,每 token 的增益分配比仅增益排名提高了 0.034 的裁决质量(95% 文档引导 CI [0.001, 0.072]),同时使用的总 token 比一次性前 5 检索少 46.6%。额外呼叫成本可以准确预测(R 平方 0.93),而有益的升级仍然难以排名(AUROC 0.60)。这些结果表明,异构成本在严格的约束下是可行的,而整个预算边界的进展取决于更强大的特定于查询的效益估计。