论文

消费级LLM Vibe-Proving的早期证据:用ChatGPT-5.2(Thinking)刻画谱区域的案例研究

Early Evidence of Vibe-Proving with Consumer LLMs: A Case Study on Spectral Region Characterization with ChatGPT-5.2 (Thinking)

应用与实践科学研究

摘要

大语言模型(LLM)日益被用作科研副驾驶,但其在研究级数学中作用的证据仍然有限,尤其对个人研究者可及的工作流而言。我们通过一个可审计的案例研究,为使用消费级订阅LLM的vibe-proving提供早期证据,该研究解决了Ran与Teng(2024)关于4-圈行随机非负矩阵族精确非实谱区域的猜想20。我们分析了七个可分享的ChatGPT-5.2(Thinking)会话线程与四个版本化证明草稿,记录了生成—裁判—修复的迭代流水线。该模型对高层证明搜索最有用,而正确性关键的收尾仍离不开人类专家。最终定理给出充分必要的区域条件与显式的边界达到构造。除数学结果外,我们还贡献了LLM辅助在何处切实有效、验证瓶颈在何处持续存在的流程级刻画,对AI辅助科研工作流的评估及人在回路定理证明系统的设计具有启示。