论文
RAISE:诊断昂贵的 LLM 信号中的采集崩溃
RAISE: Diagnosing Acquisition Collapse in Costly LLM Signals
摘要
大语言模型 (LLM) 在实际系统中越来越多地用作昂贵的按需组件,但不加区别地调用它们可能会浪费大量计算、延迟和服务预算。因此,关键的部署问题不仅在于 LLM 平均是否有帮助,还在于何时值得调用。我们确定了一种常见的故障模式,我们称之为采集崩溃:LLM 信号在聚合或事后看来可能很有用,但仍然提供太少的调用前信息来支持可靠的选择性使用。我们引入了 RAISE(信号评估中的奖励 SNR 可操作性),这是一种路由前诊断框架,用于在实施路由策略之前测试可用证据是否支持选择性使用。我们使用结构化假设嵌入 (SHE) 实例化 RAISE,这是一种冻结的 LLM 意图信号,用于每个用户使用一个 LLM 调用进行推荐,并通过受控、回顾性和新鲜队列研究以及前瞻性离线试点对其进行评估,该试点的审计决策在独立结果公布之前被冻结。在这些设置中,可预测的增量效益(而不仅仅是平均升力)区分了具有可恢复选择性值的设置;部署还取决于成本和运营限制。看似强大的预言机或子群体收益在独立评估下可能会消失。更广泛地说,RAISE 将成本高昂的推理重新定义为信息获取问题:在购买昂贵的模型、工具、传感器或测量之前,首先测试其价值在决策时是否可预测。这一原则促进了从代理工具使用和更强模型咨询到机器人传感和临床决策流程等环境中的成本意识获取。