论文

LAVOIR:让单次前向决策编码器选择澄清问题

LAVOIR: Teaching a Single-Pass Decision Encoder When and What to Ask with Amortized Value of Information

模型推理推理策略与问题分解判别式推理与决策Jev

摘要

“System One”决策模型(例如 TypeSafe 的 Jev 及其开放对应的 Laya)以经过校准的概率在一次前向传递中回答有关文本的带类型的问题,但它们无法询问丢失的信息:当第一条消息没有说明两个部门之间的区别时,它们会猜测。我们提出了 LAVOIR(具有信息价值路由的 Laya),它将缺失信息的候选片段(槽)放置在答案选项旁边的输入中,以便一次前向传递既返回决策分布,又返回每个槽的正确决策概率的预期增益(如果用户被询问)。 VOI 目标不需要人类标签:标准答案由 schema 规则生成,大语言模型仅用语言表达消息和答案,来自另一个家族的模型检查每条文本,并将每条消息与多个配置文件配对,对已实现的收益进行回归,估计预期收益。基尼不纯度上限将预测信息价值限制在校准模型仍可能取得的收益内。在一项对照研究中,对所见模式的决策在统计上与贝叶斯上限没有区别。最终模型的问题策略与所见模式上的贪婪预言机 VOI 策略相匹配(AUC 0.799 与 0.797),并且每次对话最多 0.5 个问题,比从不提问准确率提高 14.1 个百分点。在真实的 ABCD 对话中,当 LAVOIR 询问时,一次真实的交流将准确率提高了 8.3 个百分点,而当 LAVOIR 没有询问时则保持不变;在SGD数据集上,该上限将提问率从93%降至8.6%。在 Laya 的 12 个基准测试中,LAVOIR 高于 Laya 报告的 7 个基准分数,并且它在 31 毫秒内回答了一个问题(中位数,GH200)。