论文
语言模型中的隐藏API:从分叉未来中发现可复用因果接口
Hidden APIs in Language Models: Discovering Reusable Causal Interfaces from Forked Futures
摘要
相同的语言模型回答可能源自支持不同未来计算的隐藏状态,因此基于当前回答的探测无法确立可复用的内部接口。我们提出分叉未来(forked futures):仅在前缀状态形成后才采样未来操作,并通过这些操作所诱导的响应分布来比较各状态。这在无需研究者指定潜在标签的情况下,得到了关于隐藏状态的经验因果商。随后,Shared、Local、Mixture与Distributed四种接口在未来签名保真度与匹配容量约束下,按预序(prequential)因果描述长度展开竞争。在两项详细的模型评估中,Shared具有最低的留出描述长度,在Qwen2.5-1.5B上获得0.216 nats、在Llama-3-8B上获得0.294 nats的增益,同时保持紧密聚拢的平均未来签名失真;五骨干扫描保持了Sharedness Gain的正向趋势。与图形对齐的移植分析显示,Shared在目标正确性、局部性、复制保持与综合表现上联合最强,且API对齐路径介导了0.749的目标效应,而匹配的零路径仅为0.150。在盲测的四分类模型生物测试中,16个架构中有14个被正确恢复,在12个非Shared生物中仅观察到一例非Shared误判为Shared的错误。这些结果支持在所测操作库内存在一种经济高效的可复用因果接口,同时将该论断明确限定于候选架构、干预方式与留出未来。
