论文

ProtStructQA:蛋白质结构推理中的表示阈值

ProtStructQA: A Denotation Threshold in Protein Structural Reasoning

模型评测基准与评测资源

摘要

蛋白质语言系统通常通过它们是否生成可信的生物文本来评估,但结构问题具有更清晰的语义:它表示 3D 坐标系中的测量。我们引入了 ProtStructQA,这是一种蛋白质结构问答的可执行基准,其中每个自然语言问题都是从隐藏类型的域特定语言 (DSL) 程序生成的,并且通过在 AlphaFold 预测的结构上执行该程序来获得答案。 ProtStructQA 发布了 382.2K 个问题,涵盖置信度、距离、预测对齐误差 (PAE)、溶剂暴露、二级结构、拓扑和接触以及保留的成分:来自四个物种的超过 10K 蛋白质的 330K 活跃基准,加上 52.2K 硬阴性稳健性池。在没有 微调 的情况下,我们在直接提示、思维链、语法约束的可执行投票、思维链可执行投票和多轮 ReAct 式工具使用下评估从 0.6B 到 8B 的 Qwen3 模型,并复制了 Gemma-3-1B 和 Gemma-3-12B 上的标题发现。我们发现 Qwen3-1.7B 和 Qwen3-4B 之间存在一个依赖于能力的指称阈值:低于该阈值,工具介导的 ReAct 占主导地位,因为模型通常无法生成可执行的指称;低于该阈值,工具介导的 ReAct 占主导地位;在它上面,思想链从最有害转变为非常有益,并成为大多数分裂中最强的策略。解析失败和族级分析表明,阈值是从不可解析语言到可执行结构表示的过渡,而语法和执行对于 PAE 和二级结构查询仍然有选择性地有价值。 ProtStructQA 将科学 QA 重新定义为从语言到测量的编译,并为语言模型何时可以将单词映射到可执行的 3D 结构测量提供诊断测试平台。