论文
前沿模型客服反馈分析的重复运行不稳定性
Same Feedback, Different Answer: Measuring Run-to-Run Instability in Frontier-Model Customer Feedback Analysis
摘要
AI 智能体越来越多地被编程为自动化大量非结构化数据集合的知识工作。这种自动化需要可重复性:当基础证据不变时,智能体的类别、优先级和计数在运行之间不应发生重大变化,即使每个单独的答案看起来似乎合理。我们引入了一个重复运行评估框架,该框架对齐语义上等效的类别,并重点关注两个操作指标:主题流失(返回类别集中的标准化变化)和数量分歧(持续类别的计数变化)。我们评估了跨八个前沿模型、语料库大小从 100 到 5,000 条记录、多个提示和三种执行设计的三个重复客户反馈任务:原始生成、无分类分层分解以及使用持久主题、子主题和记录级预测的基于分类的智能体 (TGA)。随着 Claude Opus 4.8 和 1,000 条记录的语料库的修复,TGA 相对于原始生成和分层分解减少了 86--88% 的主题流失,而匹配的主题卷具有零分歧。基于分类的智能体比屏幕中的每个原始模型都更稳定,在每个语料库尺寸下都保持更稳定,并且在主题匹配变得更严格或更宽松时保持这一优势。尽管根据客户反馈进行了评估,但该框架的目标是更广泛地重复综合非结构化语料库,包括财务报告、法律文件、事件记录和科学文献。总体而言,这些结果表明,分类学基础可以为重复性知识工作带来更加一致和可重复的输出。