论文

LLM动作决策的控制器类选择体制理论

A Regime Theory of Controller Class Selection for LLM Action Decisions

模型推理测试时计算扩展

摘要

部署的语言和视觉语言模型必须根据每个输入决定是直接回答、检索证据、遵循更强大的模型还是弃权。与常见的单调性直觉相反,在有限样本中,更大的每输入表达力并不总是有益:在相同严格的交叉验证下,不同的基准更喜欢不同的控制器类。这反映了实例级不确定性信号的有限样本限制,该限制可以在依赖于分布的尺度上耗尽。我们将控制器组织成四个类的嵌套网格:固定操作、分区路由器、实例级控制器和先验门控控制器,按复杂性排序。我们证明了一种机制理论,将三个数据可估计的瓶颈转化为类别选择:除了最佳固定动作之外,还有多少改进可能,是否有足够的样本供实例级控制器做出可靠的决策,以及当实例级信号不可靠时,粗分区路由器可以恢复多少改进。由此产生的伯恩斯坦紧阈值具有匹配的信息论下限,并且严格的嵌套交叉验证可以证明选择接近最佳的类别。在 SMS-Spam、HallusionBench、A-OKVQA 和 FOLIO 中,预测类别与经验获胜者相匹配;当 OCR 令牌提供无标签预测时间先验时,先验门控控制器在 TextVQA 上获胜。代码可在 https://github.com/Anonymous-Awesome-Submissions/Regime-Theory 获取。

LLM动作决策的控制器类选择体制理论:论文配图
图 1:策略类的嵌套网格。 Π0\Pi_{0} 包含固定动作; Π1\Pi_{1} 包含分区路由器; Π2\Pi_{2} 包含实例级学习控制器; Π3\Pi_{3} 将确定性先验门与来自较低类的回退控制器配对。