论文
LigBench:基于 LLM 的研究想法生成的统一且人性化的基准
LigBench: A Unified and Human-Aligned Benchmark for LLM-based Research Idea Generation
摘要
随着大语言模型(LLM)的快速进展,研究思想的产生越来越受到关注。现有方法使 LLM 能够检索相关文献并为研究领域提出新颖的想法。然而,当前创意生成的评估实践仍然分散,缺乏客观标准,通常依赖于直接的 LLM 评分,这限制了他们在生成的创意的连贯分布中提供统一和可靠的评估的能力。为了应对这一挑战,我们提出了 LigBench,这是一种自动化评估基准,可以对人工智能研究思想进行细粒度和可靠的评估,并且一致适用于不同的代分布。此外,我们还引入了PAIR-IQ数据集,这是一个专门用于训练成对想法判断模型的数据集,并作为辅助参考以支持更客观的比较评估。大量实验表明,LigBench 实现了稳定且可解释的评估,显着提高了与专家判断的一致性。此外,在 PAIR-IQ 上训练的模型表现出增强的排名准确性和稳健性,为可扩展和客观的研究想法评估建立了原则标准。