论文
DeepInstructor:用于体验驱动创意评估的代理人工智能讲师
DeepInstructor: An Agentic AI Instructor for Experience-Driven Idea Evaluation
摘要
随着自动化科学发现的进步,大型语言模型(LLM)现在可以以前所未有的规模产生研究想法,将瓶颈从想法生成转移到想法评估。现有的评估者主要依赖于参数化的大语言模型知识或非结构化检索,产生的判断缺乏人类讲师所使用的基于经验的推理。为了解决这个问题,我们提出了 DeepInstructor,这是一个代理框架,它将想法评估制定为对结构化学术经验的推理。 DeepInstructor 根据 58,607 个同行评审构建了一个体验图,并采用基于 ReAct 的代理来检索特定维度的证据以进行可追踪的评估。我们进一步介绍了 DeepInstruct,这是一个在新颖性、重要性和可行性方面进行受控成对比较的数据集。实验表明,DeepInstructor 的性能大大优于现有基线,将 Hit@1 和 Hit@2 与人类判断的一致性分别提高了 24.4% 和 29.7%。我们的研究结果表明,科学思想评估可以基于对结构化学术经验的明确推理