论文
Ideation Arena:通过人类专家对战式评审评估大语言模型生成的研究构想
Ideation Arena: Evaluating LLM Generated Research Ideas with Battle-style Human Expert Assessment
摘要
评估LLM产生的研究想法很困难,因为它们的科学价值无法完全通过客观标准来确定,并且没有单一的参考答案可以指定什么才是好想法。为了应对这一挑战,我们引入了 Ideation Arena,这是一个战斗风格的平台,可通过成对的人类评估来评估研究想法。 Ideation Arena 评估 14 个前沿LLM和 5 个基于 2 个基本模型构建的研究代理架构产生的想法。为了确保有一个共同的起点,Ideation Arena 根据参与研究人员熟悉的论文构建共享的文献背景,并向所有LLM和智能体提供相同的背景。我们从 105 名活跃的计算机科学研究人员那里收集了 6,000 多个双盲成对比较,并在共享的封闭上下文协议下构建了计算机科学提案阶段专家偏好的 Elo 评级排行榜。我们通过评估者间一致性和稳健性分析来验证排名,表明排行榜在注释者组成和领域覆盖范围的变化下保持稳定。我们的结果显示代理有效性存在显着差异,一些框架提高了其骨干的构思质量,而其他框架则几乎没有带来任何好处,甚至表现不佳。我们进一步构建了 Ideation Arena Eval,这是一个评估自动评估器是否符合人类研究构思偏好的基准。对当前LLM评委的实验表明,他们仍然无法可靠地再现专家偏好,最好的评委在整体质量上达到了 72.56% 的软准确性。我们的代码、数据和排行榜可在 https://github.com/foss12138/Research-Ideation-Arena 获取。
