论文
幻觉是一种特征,而不是缺陷:评估多智能体架构,将推测性语言模型输出转换为可测试的科学假设
Hallucination as a Feature, not a Defect: Evaluating a multi-agent architecture to transform speculative language-model outputs into testable scientific hypotheses
摘要
当代的 大语言模型 (LLM) 越来越倾向于抑制幻觉,优先考虑事实检索而不是组合创造力。虽然对于减少错误信息至关重要,但这种一致性也可能通过鼓励这项工作在操作上视为语义过度拟合和多样性崩溃来限制投机性研究和开发 (R&D)。在本文中,我们提出了一种基于 Rust 的多代理编排,它使用叙事白日梦和执行控制之间的对比作为功能类比,而不是作为神经认知主张。该系统在高熵生成代理和基于网络的评估代理之间引发认识论摩擦循环,由旨在减少噪音和重复的低熵语义瓶颈调节。最初的实验在物理和社会科学领域产生了多样化的、可行的假设。我们还报告了一项探索性配对基线和消融研究,将整个系统与直接提示、自我反思、删除语义过滤器、删除搜索基础和删除横向镜头进行比较。结果将直接提示置于大多数观察到的指标中最弱的条件中,但它们并没有显示出整个系统相对于简单的自我反思的总体优越性。相反,他们认为每种架构都以不同的方式改变了原创性、可行性、多样性和经验基础之间的平衡,并且当假设必须经受住强大的物理、经验或制度约束时,整个系统提供了其主要优势。这些发现并不表明幻觉在孤立的情况下是有用的。他们认为,探索性生成只有在受到架构、经验基础和明确评估的约束时才会获得价值。