论文

解释生产检索中的脆弱性 - 增强商业建议:重现性低于重新运行稳定性基线

Paraphrase Brittleness in Production Retrieval-Augmented Commercial Recommendation: Reproducibility Below the Rerun-Stability Baseline

模型评测鲁棒性、公平性与可信度评测

摘要

买家如何表达问题的微小变化——“最佳 CRM”、“顶级 CRM”与“SaaS 初创公司的最佳 CRM”——会产生人工智能助手截然不同的品牌推荐。在 OpenAI 和 Anthropic 模型上进行约 6,000 次释义运行和约 6,000 次相同提示重新运行控制时,相同潜在购买意图的两个释义之间的推荐集相似性 (Jaccard) 对于修饰性改写为 0.288(聚类 95% CI [0.215, 0.361]),对于添加约束的改写为 0.135 ([0.098, 0.175],汇集区域/语言和特异性阶梯轴)——两者都远低于 0.50-0.61 相同提示重新运行基线。提示字符串,而不是潜在的购买者意图,是品牌出现的主要输入。增加推理努力并不能缩小差距(以 +/-0.05 为界)。这是对日益流行的 AEO/GEO 实践的直接挑战。通过计算一组固定提示中的品牌提及次数来跟踪品牌的“人工智能可见度”,会产生一个指标,其差异的主要来源是跟踪器碰巧发出的释义,而不是模型对品牌的行为:两个自然释义中的相同买家意图产生的推荐集在 Jaccard 中重叠 14-29%,而在相同提示重播中重叠 50-61%。原则上,对每个意图进行更多释义采样可以减少伪影,并且学术文献中存在有效的多提示评估方法,但自然的买家措辞空间比这些方法已验证的基准规模提示集大得多,并且远远超出了任何商业跟踪器针对每个品牌意图组合发出的内容。因此,逐提示提及跟踪作为测量单位在结构上是不稳定的;有意义的改进可能需要不同的单元而不是更大的提示集。