论文

StreamDecisionBench:评估针对不断发展的语言流的有效决策

StreamDecisionBench: Evaluating Decisions in Force on Evolving Language Streams

模型评测评测方法与指标

摘要

语言模型越来越多地在应用最新答案的应用程序中做出实时决策,直到新答案出现。迟到的答复可能会延长过时的决定,例如,当客户读出卡详细信息时,通话记录器仍在运行,离线准确性会出现错误。我们做出三项贡献。首先,我们发布了 StreamDecisionBench (SDB),这是四个应用程序系列中的八个流场景的数据集,具有源自公共规则的可执行参考决策。其次,我们提出了一个评估协议和一个指标,即有效准确度:在 0.5-8 秒的更新间隔内,所应用的决策正确的时间比例。它共同反映了准确性和延迟,将每个错误归因于判断、延迟或两者兼而有之。第三,我们评估了 13 个单模型设置,这种归因将速度受限模型与判断受限模型区分开来:较慢、较准确的模型会因为过时的答案而损失 42-51% 的时间,而快速模型则因错误答案而损失 34% 的时间。因此,我们测试混合模型,其中慢速模型纠正快速模型;通过正确的配对和配置,混合动力车的性能优于所有单一型号。然而,即使是经过最佳评估的系统也只能在大约三分之二的时间内保持正确的决策,这为实时使用留下了很大的差距。