论文
预算约束LLM验证中的异方差信号:结构异质性限制
Heteroskedastic Signals in Budgeted LLM Verification: Structural Heterogeneity Limits Optimization Gains
摘要
选择性计算大语言模型系统决定在有限的预算下输出价值验证、附加推理、工具执行或人工审计。人们很自然地期望对共享的不确定性或奖励信号进行更强大的在线优化可以改善这些决策。我们批判性地审视这个假设,并问:优化困难何时会因为信号在输入之间不可进行决策比较而失败?在预算大语言模型验证中,我们发现不确定性质量在各个成本层中是异方差的:一些区域表现出近乎随机的可辨别性,同时集中了许多错误。在显式局部模型下,我们描述了由此产生的全局分配失真,并表明其上限与跨层信号质量色散成比例。为了将微弱信号与优化器不稳定和结构不匹配分开,我们引入了受控干预层次结构:阈值、MP-Adapt、MP-Strat 和成本分层阈值 (CST)。然后,我们将诊断转化为异质门控分配(HGA),它使用预热可比性测试在全局分配和成本分层分配之间进行选择。在使用 Qwen3-8B、LLaMA3-8B 和 GPT-4o-mini 的 MBPP 和 MATH 中,全局在线自适应与静态阈值相比产生不一致的增益; CST 在强异构设置中将命中率提高了高达 17 个百分点,而 HGA 则保留了大部分收益并避免了分区无用时的盲目分层。这些发现提出了 LLM 系统的资源分配原则:在对共享代理进行更努力的优化之前,测试该代理是否在可观察的操作体系中具有决策可比性,并在该测试中控制结构专业化。