论文

通用决策模型:超越 Jev 的基准与分析

General Decision Models: Benchmarking and Insights Beyond Jev

模型评测基准与评测资源

摘要

Jev 等通用决策模型近期成为结构化判断与选择任务中生成式 LLM 的高效替代方案。但它们能够可靠处理哪些决策?当单次决策组合成更大的系统后,行为又如何变化?为研究这些问题,我们提出双语基准 JEVal,包含来自 10 个应用领域、36 个数据集的 11,257 个实例,并评估涵盖通用决策模型与生成式 LLM 的 25 种模型配置。结果表明:(1)当现有证据足以作出决策时,通用决策模型最有竞争力;当任务依赖专业知识或准确的不确定性估计时,它们表现较弱,常能找出最可能结果,却大幅高估其概率。(2)在涉及长期多步交互的动态真实系统中,快速局部决策的优势会被系统层面的可靠性失效抵消。在 $τ$-bench 上,更快的局部决策缩短了完整任务运行的中位时间,却因长轨迹中的错误累积而降低任务成功率。(3)在大规模社会模拟中,决策模型以显著更低的推理成本,在个体响应预测上接近强生成式 LLM;但用户画像能力仍较弱,汇总估计误差和系统性偏差也较大。最后,我们提出 InnerJev-4B 和 InnerJev-27B,通过 Reasoning-to-Readout Self-Distillation,将开放权重 LLM 自身的推理内化为一次前向、首个 token 的决策。InnerJev-27B 在 JEVal 上与 Jev 表现相当,典型查询的回答时间约为 0.1 秒。

通用决策模型:超越 Jev 的基准与分析的原论文方法或结果图
图 2:JEVal 概述。 (a) 数据处理管道。 (b) 每个域贡献的 11,257 个 JEVal 实例的份额。 (c) 在 cl100k_base token 中的状态、指令和候选项上测量的 JEVal 输入长度。频率轴是对数的。