论文
用隐马尔可夫模型刻画LLM依赖历史交互的可靠性
Modeling Memory-Dependent Reliability of LLMs: A Hidden Markov Model
摘要
大语言模型 (LLM) 的可靠性评估旨在估计模型在指定操作条件下产生正确响应的概率。传统的基于基准的评估通常通过总体精度来概括,提供了性能的点估计,但没有表征与可靠性声明相关的不确定性。目前,LLM可靠性评估的统计推断方法正在兴起。然而,这些模型背后的一个关键假设是测试结果可以被视为独立的重复试验。这种假设在顺序设置中可能不合适,其中稍后的响应取决于通过保留的上下文、错误传播或不断发展的交互状态的早期交互。我们通过放宽独立任务结果的假设并引入隐马尔可夫模型来捕获基准构建的交互会话中的顺序依赖性,扩展了 LLM 可靠性评估的分层贝叶斯框架。在这个公式中,结果是根据一阶马尔可夫过程演变的潜在交互状态生成的,捕获交互上下文的变化。通过使用 Anthropic Claude 和 OpenAI 在四个数据集上进行的实验,我们证明了顺序依赖性对可靠性评估的潜在影响。结果表明,忽略顺序依赖性可能会导致可靠性估计过度自信。