论文

1C:Enterprise 自然语言代码检索:开放基准和高效双编码器

Natural Language Code Retrieval for 1C:Enterprise: An Open Benchmark and Efficient Bi-Encoder

模型评测基准与评测资源

摘要

自然语言代码检索是计算机科学中一项快速发展的任务。然而,1C:企业生态系统将俄语语法与高度特定领域的术语相结合,而开放数据集和专门模型几乎不存在。我们提出了一个用于 1C 代码检索的综合管道:一个包含 3,413 个真实世界、经过 PII 清理的查询代码对的开放基准、一个可重复的评估工具和一个专门的双编码器。为了克服标记数据稀缺的问题,我们使用 Matryoshka 表示学习 (MRL) 和隐私感知标记器对 google/gemma-4-26B-A4B-it 从公共代码存储库生成的 784,057 个合成三元组进行微调。由于基准子集的大小不同,我们报告平衡子集宏观结果、查询加权微观结果和仅论坛结果。我们的模型在论坛上达到了 0.5992 平衡宏 nDCG@10、0.5044 微和 0.4617,而基线架构的宏为 0.4932,google/embeddinggemma-300m 为 0.5404。删除保守的精确/13 克重叠审计标记的每个基准示例,留下 0.6011 平衡宏观(0.5010 微),表明检测到的训练基准重叠并不能解释标题结果。 MRL 截断为 256 维可保留 99.9% 的检索质量,同时将密集索引存储和精确相似性算术减少三倍。