论文
Frontier LLM 如何适应神经分歧背景:系统提示反应中表面与结构变化的测量框架
How Frontier LLMs Adapt to Neurodivergence Context: A Measurement Framework for Surface vs. Structural Change in System-Prompted Responses
摘要
我们检查基于前沿聊天的 大语言模型 (LLM) 是否根据系统提示中的神经分歧 (ND) 上下文调整其输出,并描述这些调整的性质。具体来说,我们提出了 NDBench,这是一个 576 输出基准,涉及两个前沿模型、三种系统提示类型(基线、ND-profile 断言和带有明确调整指令的 ND-profile 断言)、四个规范 ND 配置文件以及跨四个类别的 24 个提示,其中一个涉及对抗性屏蔽策略。我们的研究结果一致出现了四种趋势。首先,LLM 在 ND 环境下表现出显着的适应性,其中完全指导的条件产生更长、更结构化的输出,其特征是更高的标记计数、更多的标题和更细粒度的步骤(p < 10^-8,Holm 校正)。其次,这种适应本质上很大程度上是结构性的:尽管列表密度变化不大,但标题和每步细节的频率显着上升。第三,仅 ND 角色断言无法抑制潜在的有害倾向,因为掩蔽强化仅在明确指示的情况下才会减少(减少 36-44%);在人物断言条件下,减少率几乎没有变化。此外,基于LLM的危害评估的可靠性分析表明,六个维度(掩蔽和强化、验证质量)中只有两个超过了预先定义的法官间一致性标准(alpha >= 0.67),因此可以被视为初步结果。 NDBench 与其提示、输出、代码和其他资源一起公开,形成了一个可重复的框架,用于审核未来 LLM 对 ND 意识的适应。