论文
LLM动作决策的控制器类选择体制理论
A Regime Theory of Controller Class Selection for LLM Action Decisions
摘要
部署的语言和视觉语言模型必须根据每个输入决定是直接回答、检索证据、遵循更强大的模型还是弃权。与常见的单调性直觉相反,在有限样本中,更大的每输入表达力并不总是有益:在相同严格的交叉验证下,不同的基准更喜欢不同的控制器类。这反映了实例级不确定性信号的有限样本限制,该限制可以在依赖于分布的尺度上耗尽。我们将控制器组织成四个类的嵌套网格:固定操作、分区路由器、实例级控制器和先验门控控制器,按复杂性排序。我们证明了一种机制理论,将三个数据可估计的瓶颈转化为类别选择:除了最佳固定动作之外,还有多少改进可能,是否有足够的样本供实例级控制器做出可靠的决策,以及当实例级信号不可靠时,粗分区路由器可以恢复多少改进。由此产生的伯恩斯坦紧阈值具有匹配的信息论下限,并且严格的嵌套交叉验证可以证明选择接近最佳的类别。在 SMS-Spam、HallusionBench、A-OKVQA 和 FOLIO 中,预测类别与经验获胜者相匹配;当 OCR 令牌提供无标签预测时间先验时,先验门控控制器在 TextVQA 上获胜。代码可在 https://github.com/Anonymous-Awesome-Submissions/Regime-Theory 获取。
