论文

SciText2Eq:评估LLM面向科学创造力的可解释方程生成

SciText2Eq: Assessing LLMs for Explainable Equation Generation for Scientific Creativity

模型评测基准与评测资源

摘要

本工作考察大语言模型(LLM)从科学文本生成数学方程的能力。先前工作面临非结构化锚定、多方程依赖与人类对齐评估的挑战。为此——我们构建AI研究论文数据集——把上下文段落与真值方程及变量描述配对。我们开发可解释方程生成工作流——并在多样开放与闭源LLM骨干上评估。我们引入组合自动指标、LLM量规与人类判断的评估协议——评估准确性、可解释性与人机对齐。结果表明:LLM在词汇与句法相似度上表现中等——而语义准确度上挣扎。基于LLM的评估与人类判断的比较揭示有限对齐——凸显用LLM评估方程质量的挑战。这些发现为改进方程生成模型与开发更可靠的科学文本评估方法提供洞见。我们提供代码与数据以支持复现。

SciText2Eq:评估LLM面向科学创造力的可解释方程生成:论文配图
图 1:从非结构化文本生成方程的三个关键挑战。