论文

哪些算法规范格式有助于语言模型实现机器学习算法?

Which Algorithm Specification Formats Help Language Models Implement Machine Learning Algorithms?

模型评测模型能力评测

摘要

大语言模型 (LLM) 越来越多地用于实现研究手稿中的算法,但论文通常会隐含实现选择。本研究研究了算法规范的书面格式如何影响首次通过 LLM 实现的准确性。我们比较了五个机器学习任务、三个模型和四个实验设置中的普通散文、LaTeX 算法风格的伪代码、类似 PDF 的提取伪代码、Markdown 字段、类似 YAML 的规范、类似 JSON 的规范和 Python 代码存根,生成了 4,020 个生成的实现。隐藏测试评估通常决定正确性的细节,包括平局打破、数组形状、数值规则、返回结构和无效输入行为。在核心信息设置下,LaTeX算法式伪代码的平均格式效果最大,类YAML规范和普通散文紧随其后。在完整信息下,GPT-5.4 mini 在匹配比较中没有显示格式差异,而 Gemma 3 4B 和 Llama 3.2 3B 仍然存在格式差异。尽管指定了函数签名,代码存根并不能始终如一地提高正确性。结果支持写作建议:作者应该明确说明接口、计算步骤、数值规则和边界情况行为,而不是依赖特定的表面格式来承载这些细节。