论文

BudgetVerify:按预算为金融问答选择验证强度

BudgetVerify: Budget-Tiered Verification for Financial QA

模型推理测试时计算扩展

摘要

财务问答通常需要精确的数值提取、单元处理以及表格和文本的算术,但应用昂贵的验证通常会浪费测试时计算。我们提出了 BudgetVerify,这是一个预算分层的生成器验证器框架,它将每个生成的答案路由到三个验证层之一:无验证、轻量级检查和修订或成本较高的先解决然后比较验证。路由器根据离线正确性和词元成本结果进行训练,并在测试时使用验证之前可用的信息(包括问题、上下文统计数据、生成的答案和关联的生成器元数据)选择验证层。所选层要么直接返回生成的答案,要么调用相应的验证器。在六个商业和开放权重基础模型中,BudgetVerify 仅在有用时有选择地分配更强的验证,从而始终比固定验证策略产生更有效的准确性成本帕累托前沿。尽管不同模型的绝对性能有所不同,但这些效率增益和由此产生的定性前沿形状在不同发电机模型中是一致的。