论文

LLM能一眼认出好假设吗?基于Logit的能量打分在科学假设排序上胜过提示式LLM-as-Judge

Do LLMs Know a Good Hypothesis When They See One? Logit-Based Energy Scoring Outperforms Prompted LLM-as-Judge for Scientific Hypothesis Ranking

模型评测评测方法与指标

摘要

大语言模型(LLM)正被越来越多地用于科学假设生成。然而,如何评估生成的假设,对于可信的AI驱动科学工作流仍是一个挑战。现有方法常把LLM用作评审或依赖语义相似性,这可能偏爱熟悉想法而冷落新颖想法。我们提出一种基于logit的能量打分方法,用语言模型的内在置信度而非比较式判断来评估假设。我们在12个学科的1,323篇论文上对七个语言模型进行了基准测试,每篇论文与其假设及十五个错误备选项配对。内在打分在两个打分器合并统计下达到33.0%的Hit@1,而提示式列表排序为16.6%。最强配置——一个使用基于logit能量打分的10亿参数模型——达到53.1%,但这是14个模型×打分器组合中事后选出的最大值。总体而言,内在模型置信度在科学假设评估中显示出潜力。本研究也激励了未来针对可信AI驱动科学发现的置信度类方法研究。

LLM能一眼认出好假设吗?基于Logit的能量打分在科学假设排序上胜过提示式LLM-as-Judge:论文配图
图1:研究概览。给定背景与研究问题,候选假设由语言模型的内部置信度评分,而非通过提示词比较。53% 是 14 种模型×评分器组合中的最佳结果。