论文
ConvexBench:LLM 能识别凸函数吗?
ConvexBench: Can LLMs Recognize Convex Functions?
摘要
凸分析是现代数学的一个分支,应用广泛。随着大语言模型(LLM)开始自动化研究级数学与科学,LLM 能否理解并运用凸性进行推理变得重要。我们提出 ConvexBench,一个可扩展且可机械验证的基准,测试 LLM 能否在深度函数复合下识别符号目标的凸性。在前沿 LLM 上的实验揭示出急剧的组合推理鸿沟:性能随深度增加迅速退化,F1 分数从深度2时的1.0降至深度100时的约0.2。对模型推理轨迹的检查指出两种失败模式:解析失败与惰性推理。为解决这些局限,我们提出一个 Agentic 的分治框架:(i) 将解析交给外部工具以构建抽象语法树(AST),(ii) 在聚焦上下文下对每个中间子表达式强制递归推理。该框架可靠地缓解深度复合失败,在大深度下取得显著性能提升(例如深度100时 F1 分数为1.0)。
