错误的设计意图比不进行调节更糟糕:CAD 程序完成中的标头调节的紊乱控制诊断
Wrong Design Intent Is Worse Than Never Conditioning: A Derangement-Control Diagnosis of Header Conditioning in CAD Program Completion
摘要
微调代码 LLM 通常会根据设计意图规范进行调节,但此类信号的正确性轴(错误的意图而不是缺失的意图)尚未经过测试,并且通常使用定义信号的同一检测器来对调节的好处进行评分。我们研究了 CADCON,这是一个在 Qwen2.5-Coder-1.5B 的 LoRA 微调 期间添加到 CadQuery 样式程序中的五功能设计意图标头,对与标头定义提取器不共享代码的可执行几何断言的遵守情况进行评分。在预先注册的 400 个重复数据删除保留程序样本中,这些程序分层在 11 个意图配置文件中,具有 40% 的前缀和三个种子,语义上错误的标头会降低在程序级别的两种标记化下的 3/3 种子上以及在它们呈现的 298 个不同模型输入下的 3/3 标记和 2/3 文本种子上从未经过标头训练的基线以下的遵守情况。相对于该基线,错误标头的可执行性并未降低。经过重新训练的混乱控制,使每个程序都接收另一个程序的标头——保持标头边缘固定,同时破坏其与程序的相关性——看到相同的程序、索引和错误的标头。其正确到错误的变化为 -0.006/+0.016/-0.003,而标准模型为 0.124/0.241/0.230,并且交互作用在 3/3 种子上显着 (p <= 5.9e-7),因此模型对标头正确或错误的敏感性需要学习映射。控件位于正确标题下与错误标题下的基线下方相同的边缘,因此我们声称敏感度而不是低于基线水平。对于真正意图所缺乏的功能,标准模型在错误的标头命名时更频繁地实现该功能;控件没有。 真值 本身在这里的得分仅为 0.567,这是读取手臂水平的尺度。错误的设计意图并不是惰性的:它主动地误导了一代人。