论文
提取代理假设推理的基础模型:混合 LLM+SLM 架构中的成本、延迟和治理
Distilling Foundation Models for Agentic What-If Reasoning:Cost, Latency, and Governance in a Hybrid LLM+SLM Architecture
摘要
表格基础模型通过上下文学习提供强大的零训练预测性能,但其高推理延迟使得它们作为交互式代理循环中的热路径决策后端不切实际。我们通过 UCI Adult 和五个 OpenML 基准的业务决策模拟,将 TabPFN 教师提炼为紧凑的前馈学生:分类头将 5320 万个参数压缩到 8,546 个(6,220 倍);部署的双头贷款管道将 111.4M 个参数压缩至 17,059 个(6,532x)。学生保留了 95.4-100.5% 的准确率和 96.8-100.0% AUC,其中 Credit-g 的准确率保留率最低为 95.4%; alpha = 0 硬标签对照显示教师的软目标提供了 2.1-7.0 AUC 点增益。