论文
深入合唱团:自由列表提取揭示大语言模型合奏中独特的模型声音
Reach Into The CHOIR: Free-List Elicitation Uncovers Distinct Model Voices in LLM Ensembles
摘要
当多个系统似乎提供独立的观点同时返回相同的熟悉的默认值时,开放式大语言模型同质性可能会造成错误的多元化。单遍答案模糊了严格约束的答案空间、即时词汇回声和更广泛的答案空间(表面下有稳定的替代方案)产生的一致性之间的区别。我们引入了 CHOIR(集体分层排序查询响应),这是一个将认知人类学的自由列表启发应用于大语言模型集成的框架。 CHOIR 反复得出排名列表,将项目聚类为提示级别概念,并测量跨模型、提示变体和人物角色条件的概念显着性。我们在 Infinity-Chat 100 上评估 CHOIR,Infinity-Chat 100 是最近关于开放式模型同质性工作的外部提示库,以及旨在隔离机制级别对比的包含 27 个问题的目标诊断库。在 Infinity-Chat 100 上,CHOIR 再现了高表面一致性(93/100 提示高于机会),同时将窄提示与具有可恢复深度的宽提示分开。在目标探测和外部提示库中,基本模型身份仍然是最强的可恢复签名,而角色提示则改变了基本模型签名中浮现的概念。源盲排序模块优先考虑稀有但稳定的候选者以供以后检查。 CHOIR 通过询问模型在何处收敛、为何收敛以及在结构化深度探测下仍可达到什么,将开放式同质性转变为诊断测量问题。