论文

超越最终提示:衡量对话内上下文对人工智能答案的影响

Beyond the Final Prompt: Measuring the Effect of Within-Conversation Context on AI Answers

模型评测模型能力评测

摘要

孤立的最终用户消息通常被视为人工智能系统评估中的查询。然而,在对话中,可操作请求可能分布在之前的回合中。我们直接测试省略的对话内上下文是否会改变答案。对于从受监管的商业语料库和公共 PRISM 数据集中采样的 180 个英语多轮对话中的每一个,我们保持最终用户消息和请求答案模型不变,同时生成三个答案:一个来自完整的角色标记对话,一个仅来自最终消息,一个来自最终消息加上仅限于 160 个单词的前缀重建。单独请求的判断模型评估随机标签下的答案。预先指定的主要终点是可能改变用户行为的实质性差异,而不是风格或细节上的差异。对符合条件的群体进行逆概率加权后,44.7% 的案例中完整对话和孤立最终答案存在重大差异(95% bootstrap CI 33.8% 至 56.1%)。在 0 到 4 的请求满意度量表(0.32 到 0.67)上,完整对话的答案得分高出 0.49 分。添加压缩前缀可将材料差异率降低至 30.8%(20.2% 至 42.1%),降低 13.9 个百分点(4.9% 至 24.1%),并将平均满意度差距降低至 0.01 个百分点(-0.12 至 0.13)。然而,压缩并不等于完整的对话上下文:几乎三分之一的答案仍然存在实质性差异。对 48 个案例进行顺序交换重复后,初步决策的一致性达到 91.7%,kappa = 0.83。该研究涉及同一对话中的前几轮,并且没有测试不同对话中的持久记忆。