MemToC:大语言模型 中的内存工具冲突解决基准测试
MemToC: Benchmarking Memory-Tool Conflict Resolution in Large Language Models
摘要
当工具返回与其参数记忆冲突时,工具增强的 LLM 必须在两个易出错的源之间进行仲裁,但现有的评估在未确定源正确性的情况下测量源偏好。我们引入 MemToC,这是一种使用可执行工具进行工具返回后仲裁的受控基准。 MemToC 包含 6,504 个评估片段,这些片段由 542 个质量控制的事实问题构成,独立引出特定于模型的闭卷答案,以及已知正确性的受控工具返回。这些组件实例化了四种源正确性情况;工具错误和无工具条件是单独的控制。在五个开放式重量 7-9B 模型中,工具回报在闭卷答案中占据主导地位。四种指令调整模型仅在 6.5-17.1% 的合格案例中针对不正确的工具保留了经过验证的正确答案,在 86.0-93.1% 的情况下遵循正确的工具,并在 78.4-86.0% 的两个来源都错误的情况下重复工具返回。在问题和剧集内容保持固定的情况下,跨模型排序在三种指令措辞变体中都不会保持稳定。我们使用 ToolHop 上的链级交叉拟合将提示与 SFT 和 DPO 进行比较,因此共享基本事实的问题永远不会跨越训练和评估。我们采用不对称的成功标准:正确答案的保留率必须提高,而不会检测到正确工具跟随的减少。 SFT 和 DPO 在四个指令调整主干中的相同两个上满足此标准。改进很少是干净利落的:20 个经过测试的方法模型组合中有 19 个减少了工具错误或无法回答的输入后的弃权。超越 MemToC 的迁移是积极的,但也是部分的,并且取决于模型和表示框架。正确性条件仲裁可以通过 微调 进行改进,但收益必须与正确的工具使用、弃权和制定的稳健性一起评估。