论文
关系响应场:黑盒 LLM 响应一致性和恢复的一般理论
Relational Response Fields: A General Theory of Black-Box LLM Response Consistency and Recovery
摘要
黑盒语言模型的可靠性通常通过采样、提示、投票、验证或迭代修改个体答案来追求。我们提出一个先前的问题:\emph{什么决定了黑盒响应的集合是否可以恢复?}我们将对查询的类型化转换的响应表示为\emph{关系响应字段}(RRF)。边缘传输编码有效响应在释义、缩放、分解、重构或其他任务对称性下必须如何改变;锚点对独立可信的证据进行编码,例如执行或验证者。对于关系算子$D$、锚算子$A$和最多$k$个损坏的响应节点,我们将$γ_k(D,A)$确定为黑盒响应恢复的内在难度。当每个 $k$ 节点损坏都可识别时,它就是积极的;它给出了与 $1/γ_k$ 成正比的确定性稳定性界限;匹配的两点极小极大下界表明没有估计器可以改善这种依赖性。因此,一致性并不是真理:仅关系方法对零方向视而不见,包括共同的幻觉。我们推导了稀疏场修复算法,同时将信息论可识别性与凸优化所需的更强的零空间条件分开。受控定理测试和黑盒数学/代码实验评估了四种理论固定的结果:一致性——真值分离、锚相变、冗余饱和以及修复难度的跨模型、跨任务预测。结果支持 $γ_k(D,A)$ 作为响应恢复实例的可测量属性,而不是附加到一个修复启发式的分数。