论文

TACIT:探测 LLM 隐状态中的工具能力要求

Structured but Silent: Probing Capability Requirements in LLM Hidden States

模型评测模型行为与机制分析

摘要

可靠的工具使用需要的不仅仅是触发机制或将查询与 API 描述相匹配。在选择特定工具之前,智能体必须首先推断用户查询隐含的功能要求。在本文中,我们研究了这些查询端能力要求是否可以在生成之前从 LLM 隐藏表示中线性解码,以及这种隐藏状态可访问性与显式语言分类的比较如何。我们引入 TACIT,这是一个框架,它沿着三个基本轴分解外部需求:源、转换和世界效应,定义八个结构不同的能力类别。使用来自基准、综合示例和新领域场景的 1,600 个平衡训练查询,我们在来自四个 开放权重 LLM 系列的预生成隐藏状态上训练线性 探针。我们的实证结果表明,细粒度的能力结构在所有模型中都可以高精度地线性解码。然而,至关重要的是,我们暴露了表示到语言化之间的差距:当要求用自然语言对相同的查询进行显式分类时,这些相同的模型的可靠性明显降低。这种脱节表明有关所需外部功能的信息可以在 LLM 隐藏表示中线性访问,但不能可靠地表达,我们将这种现象定义为“结构化但无声”。

TACIT:探测 LLM 隐状态中的工具能力要求:论文原图
图 1:TACIT 探测框架概述。 (I) 给定用户查询,我们在生成之前在最终提示 token 处提取隐藏状态。单独的线性 探针,根据每个轴的验证数据选择一个层,预测源、转换和世界效应,共同定义八个能力类别。 (II)我们通过两项分析来检查这些预测:(A)对误导性表面线索的鲁棒性,将 探针 与欺骗性查询的词汇和句子嵌入基线进行比较; (B) 表示到语言化的差距,将 探针 预测与同一模型的显式语言分类进行比较。