论文

LLM 中回复的语义变异性:对设计基于对话的评估的影响

Semantic Variability of Replies Across LLMs: Implications for Designing Conversation-Based Assessment

模型评测鲁棒性、公平性与可信度评测

摘要

本研究检查当底层 LLM 发生变化时,LLM 生成的回复是否保持语义一致。使用来自真实协作对话的消息,我们比较了在两种条件下 LLM 生成的回复的语义相似性:有和没有先前的聊天历史记录。结果表明,模型选择和对话上下文都会影响响应的相似性以及与人类回复的一致性。这些发现表明,仅提示和对话上下文可能不足以保持整个 LLM 的响应一致性,这凸显了对基础设施和设计策略的需求,这些基础设施和设计策略可以在 LLM 的快速和持续发展中保持稳定和可比较的响应。