论文
不提供无法执行的技能:大规模LLM技能选择的确定性可执行性门控
Don't Offer What Can't Be Done: Deterministic Executability Gating for LLM Skill Selection at Scale
摘要
生产LLM代理选择从大型技能库中选择技能,面临一个限制:即使技能与用户的话题匹配,但当前账户状态无法执行。我们为Wix的客户支持助手Helpmate提供了一个部署的三阶段选择管道。首先,一个基于召回的语义匹配器识别与十技能领域家族相关的消息,而不咨询账户状态。其次,一个确定性的可执行性门禁移除候选者,其内部硬止条件成立。因为门禁和技能都评估相同的退出条件,每块候选者在相同的账户状态下都无法完成,只要条件保持一致且双方都观察到新鲜权威状态。最后,LLM决定是否调用剩余的候选者。在75.66万条用户消息和26.76万个对话的生产分析中,语义匹配保留了174,927个消息(23.1%)。在这些匹配的流中,门禁从1,749,270对技能—消息中移除了1,039,462对(59.4%),节省了228.8百万技能描述令牌——这是后语义技能描述足迹的59.1%。总的来说,语义匹配和可执行性门禁减少了技能描述的上下文,相对于暴露所有十种技能,相对减少了90.5%。为了测试这种修剪是否影响模型行为,而不是仅影响上下文大小,我们重播了一个风险增强的1,000个对话,其中所有十种技能都暴露。模型在78个对话中选择了生产阻塞的技能(7.8%)。这个反事实结果表明,确定性的门禁阻止非可执行候选者影响模型选择,而没有声称下游工具执行或客户结果影响。
