论文
路径很重要:在 KGQA 中评估超出答案准确性的小语言模型
The Path Matters: Evaluating Small Language Models Beyond Answer Accuracy in KGQA
摘要
小语言模型 (SLM) 越来越多地与知识图 (KG) 配对,但端到端 KG 问答将图访问、搜索、导航、推理和答案生成合并在一起。这种耦合使得很难确定 SLM 是否能够忠实地执行问题所暗示的推理路径,也很难将失败归因于导航而不是管道的其他阶段。我们通过采用 THESEUS 导航和可追溯性框架并使用冻结的现成 SLM 作为本地操作策略来隔离此功能。在每一跳,环境都会公开合法的传出图操作,并且模型选择一个可执行图操作并决定是否停止,而无需特定于任务的参数更新、模型控制的波束搜索或自由格式的答案生成。这种受控设置使我们能够使用路径编辑距离 (PED) 作为主要轨迹指标,通过 Hits@1 以及路径保真度来评估终端答案的准确性。在 Kinship 和 MQuAKE-ST KGQA 中,相似大小的本地模型在答案准确性和路径保真度方面存在很大差异,这两个指标有时有利于不同的模型。这种依赖于模型的行为也延伸到提示,因为单个演示轨迹可以根据模型改善或降低导航。这些结果促使我们评估 SLM 图推理,而不仅仅是端点准确性。