论文
拒绝编码的图书馆员:LLM 代码生成中模型相关的身份制定
The Librarian Who Refused to Code: Model-Dependent Identity Enactment in LLM Code Generation
摘要
传记角色广泛用于系统提示中,但它们对代码生成的影响很少在受控、预先注册的条件下进行评估。我们测试了四个提示条件(无角色、两个工程师角色和一个研究图书馆员角色)、12 个代码生成任务、两个前沿模型以及每个单元 5 次运行(480 次完成)。两个测试模型之间的角色效应有所不同。在预先注册的混合效应分析下,条件与模型的相互作用对于提供商报告的输出词元具有重要意义;事后可见特征测量显示出相同的定性模式。六个 GPT-5.5 完成情况有长度限制并单独报告。在 Claude Opus 上,极简主义工程师角色将可见输出减少了 30%(提供商词元为 33%),而没有提高正确性,而彻底的工程师角色则增加了输出,但没有提高正确性。在一项探索性事后分析中,图书馆员角色在 60 个 Opus 响应中的 55 个和 12 个真正的无代码响应中引发了角色内的免责声明,将平均正确性从 0.92 降低到 0.67。 GPT-5.5 在其 59 个未截断的响应中没有产生任何行为。这些结果与充当模型相关行为政策偏差而不是普遍质量干预措施的角色一致。我们发布原始完成结果、派生分数、分析工件、预注册文档和执行门日志;基于端到端测试的重新评分需要未发布的任务工具。