论文
3D 几何计算机视觉中博士级编码的基准测试
Benchmarking PhD-Level Coding in 3D Geometric Computer Vision
摘要
AI 辅助编码迅速重塑了软件实践和研究工作流程,但当今的模型仍然难以为复杂的 3D 几何视觉生成正确的代码。如果模型能够可靠地编写这样的代码,我们社区的研究将会发生重大变化。为了衡量实现这一目标的进展情况,我们引入了 GeoCodeBench,这是一个评估 3D 视觉编码的博士级基准。每个问题都是从最近的代表性论文中挑选出来的填充函数实现任务:我们首先让工具从官方存储库中提出候选函数,然后进行仔细的人工筛选以选择核心 3D 几何组件。对于每个目标,我们都会生成多样化的边缘情况单元测试,从而实现全自动、可重复的评分。我们评估了八种具有代表性的开源和闭源模型,以反映当前的生态系统。最好的模型 GPT-5 仅获得 36.6% 的通过率,揭示了当前能力与可靠的 3D 科学编码之间的巨大差距。 GeoCodeBench 将任务组织为两级层次结构:一般 3D 能力(几何变换和力学/光学公式)和研究能力(新颖的算法实现和几何逻辑路由)。这些轴上的分数呈正相关,但以研究为导向的任务明显更困难。上下文消融进一步表明,“更多纸质文本”并不总是更好:在方法部分进行切断在统计上优于全文输入,突显了长上下文科学理解中尚未解决的挑战。总之,这些发现将 GeoCodeBench 定位为从通用编码推进到值得信赖的 3D 几何视觉编码的严格测试平台。