论文
FrontierSmith:大规模综合开放式编码问题
FrontierSmith: Synthesizing Open-Ended Coding Problems at Scale
摘要
许多现实世界的编码挑战都是开放式的,并且不存在已知的最佳解决方案。然而,LLM 编码的最新进展主要集中在明确定义的任务上,例如功能实现、错误修复和竞争性编程。开放式编码仍然是 LLM 的弱点,很大程度上是因为开放式训练问题稀缺且构建成本高昂。我们的目标是大规模综合开放式编码问题,以训练更强大的 LLM 编码器。我们引入了 FrontierSmith,这是一个自动化系统,用于从现有的封闭式编码任务中迭代地演化出开放式问题。 FrontierSmith 从竞争性编程问题出发,通过改变问题的目标、限制输出和推广输入范围来生成候选的开放式变体。然后,它使用定量的想法分歧度量来选择问题,从而从不同的求解器中引出真正不同的方法。然后,代理为幸存的候选人生成测试用例和验证程序。在两个开放式编码基准上,对我们的合成数据进行训练比基本模型产生了显着的收益:Qwen3.5-9B 在 FrontierCS 上得分提高了 +8.82,在 ALE-bench 上得分提高了 +306.36(基于 Elo 评级的性能); Qwen3.5-27B 分别提高了 +12.12 和 +309.12。综合问题还使代理采取更多轮次并使用更多词元,类似于人工策划的词元,这表明封闭式种子可以成为长期编码数据的实用起点。