论文

快速决策模型何时应切换到复杂推理?

System Switch: When Should a Fast Decision Model Stop and Think?

模型评测模型推理智能体系统判别式推理与决策Agent 架构与控制循环鲁棒性、公平性与可信度评测

摘要

双过程Agent将快速策略与较慢的推理模型配对。在实时环境中,慢模型通常持续运行;在回合制Agent或机器人规划中,则常由不确定性或故障等事件触发调用。我们研究一种快速执行策略:每次决策由它完成,只有满足门控条件时才将控制权交给推理型视觉语言模型,而游戏环境始终继续运行。实验采用闭环Doom及新开放的“System One”类型化决策模型,通过统一llama.cpp接口提供服务。900个留出问题上的结果表明:(1)0.15B至9B参数的零样本决策模型,在错误答案中选择收集物品的频率为随机概率的1.6—1.8倍,这一现象在不同选项顺序下均存在,但顺序会影响部分模型的准确率。(2)准确率、校准与敏感性是不同属性;敏感性指置信度区分正确和错误答案的能力。准确率相近的模型,其AUROC可能差异很大。敏感性最高模型的置信度主要追踪易失败的情境类型,而不直接对应哪些具体答案错误。(3)离线将置信度最低的30%决策转交推理模型,相较随机转交的收益与执行策略AUROC成比例,排序相关系数为0.87。在留出游戏上选定策略和转交比例后,采用doomLaya选项顺序时收益为+0.13[0.08,0.18],打乱选项后为+0.08[0.02,0.14],约一半收益来自推理。(4)在三个随机种子、33局闭环游戏中,所有变体均未到达出口。坚持执行推理模型的计划或固定探索规则可以打开更多门,并让原本停滞的策略继续行动;但固定规则也使Agent更频繁死亡。告知推理模型部分门需要钥匙后,它会把普通门误判为锁着的门,而状态信息不足以区分;不提供这条知识时,它又回到收集物品的行为。我们发布代码、提示词、数据与日志。