论文

提示不是查询:请求状态如何在多轮 AI 对话中演变

The Prompt Is Not the Query: How Request State Evolves Across Multi-Turn AI Conversations

模型评测评测方法与指标

摘要

人工智能搜索评估通常将提示视为可以单独计数、分类和重放的稳定查询。对话使该分析单元变得可疑:每个用户都可以添加约束、修改假设、请求证据或参考之前建立的替代方案。我们用可观察的构造、会话条件请求状态替换潜在的“意图”,并测量该状态如何在用户轮流中分布。该分析重复使用了冻结规则和先前对话研究的受控队列:发现-复制设计中的 670 个英语商业多轮对话以及来自 1,389 名参与者的 7,463 个公共 PRISM 对话。在商业语料库中,最终提示包含会话独特用户端内容词汇量的中位数 35.6%;在 PRISM 中,中位数为 36.4%。最终提示分别在 68.4% 和 74.3% 的对话中包含最多一半的词汇。更重要的是,透明规则在 50.3% 的商业对话和 44.8% 的 PRISM 对话中检测到历史中至少一个请求状态维度,但没有在最终提示中检测到。在带有维度的对话中,最终提示仅以 26.1% 和 26.2% 的比例再现了完整观察到的维度集。同时,最终的提示在 17.9% 和 19.3% 中添加了以前未见过的维度,表明端点既不是摘要,也不仅仅是参考:它往往是另一个状态更新。长度匹配的空值表明词汇覆盖率低很大程度上是轮次长度的结果,因此词汇结果被解释为信息可用性,而不是语义漂移。分类结果支持人工智能搜索的会话级测量。他们没有估计历史对模型答案的因果影响。