论文
AlgoREval:算法代码的参数化检索评测
Are you Synthesizing or Recalling? Evaluating LLMs on Algorithmic Code Retrieval
摘要
大语言模型在代码生成上表现强劲,其成功既依赖回忆相关算法知识,也依赖如何应用它的推理。但现有LLM管道不透明,两个成分没有显式分离。我们主张:对规范实现广泛存在于预训练语料的著名算法,代码生成更适合作为参数化代码检索来测量——从内化知识复现一个被点名的算法,而非合成新算法。我们提出AlgoREval,包含横跨14领域77个经典算法、7种编程语言与4种图输入表示的599题,隔离评估该能力,并在零样本设置下评估15个模型(7B-34B参数)。我们发现即使在广泛文档化的算法上,检索准确率在语言与输入表示间也差异显著;用检索到的代码片段或结构化算法提示做提示增强可改善复杂算法的准确率;SFT带来更广的语言增益,GRPO在特定语言上获得更大的逐语言增益。结果确立参数化代码检索为一种独立可测的能力,并警示不要在没有系统验证的情况下部署AI生成的算法代码。代码/项目页:https://github.com/Nickil21/AlgoREval。