论文
代码的词元签名:比较大型语言模型的编码行为
Token Signatures of Code: Comparing Coding Behaviors Across Large Language Models
摘要
大型语言模型 (LLM) 对编码任务的评估主要集中在 pass@k 等性能指标上。随着大语言模型的不断进步,许多模型现在满足基线性能要求,从而降低了仅基于性能的评估的判别力。然而,一个关键问题在很大程度上仍未被探索:大语言模型的编码行为有何不同?我们提出了 CLIC(代码识别和比较学习),这是一种可视化分析方法,通过词元频率分析来表征 LLM 编码行为。 CLIC 将每个代码样本表示为词元频率的特征向量,并训练可解释的决策树来分离两个大语言模型的代码集。除了分类准确性之外,我们还定义了两个新指标:鲁棒性,衡量两个大语言模型在最具辨别力的标记被逐步删除时是否保持可区分性;以及集中度,衡量差异是由少数主要标记驱动还是分散在许多标记中。解释大量的成对比较(跨大语言模型对、任务和标记化级别)并跟踪完整的分析链形成了本质上多尺度、假设驱动的探索任务。因此,我们开发了一个交互式视觉分析系统来导航比较环境,识别兴趣对,并深入了解有区别的标记及其代码上下文。比较 10 个大语言模型跨 22 个 Kaggle ML 任务的案例研究揭示了大语言模型选择和提示工程的可行见解。