论文
DiagFlowBench:评估语言模型在锚定诊断对话中如何处理程序外输入
DiagFlowBench: Evaluating How Language Models Handle Off-Procedure Inputs in Grounded Diagnostic Dialogue
摘要
语言模型日益在维护作业中充当咨询系统。为防止幻觉——既有方法把模型锚定到程序性文档——约束其遵循规定序列。但实践中操作员可能偏离这些步骤——要求模型识别未编排的程序外话语。当前基准很少优先考虑该能力。我们介绍DiagFlowBench——把某消费产品制造商的50张工业诊断流程图转为1,676段多轮对话的数据集——对照合规与程序外话语。对十个商用与开放权重模型的评估显示弃答率差异巨大——模型常选择一个真实但在上下文中不恰当的步骤——而非捏造事实。这种“映射到错误建议”固有的貌似合理与权威性——暴露了锚定系统的一个棘手脆弱点。代码与数据发布于 https://github.com/guille-gil/DiagFlowBench。
