推力载荷下材料失效的阿谀奉承:跨三种载荷工况和多达十七种材料装料的多轴表征
Sycophancy as Material Failure under Pushback Loading: A Multi-Axis Characterization Across Three Loading Cases and up to Seventeen Material Charges
摘要
LLM 中的阿谀奉承已在 70 多篇论文中得到记录,但关于构造边界的专家共识仍然很低(ICC=.184;Ye 等人,2026)。构造碎片是因为行为分类取决于哪种表面形式具有特权。我们采用材料科学框架:对话作为负载下的测试样本,LLM-模型作为材料负荷,推回作为渐进负载,姿态翻转作为材料失效。我们使用涵盖速度、损伤累积、框架漂移、脆性和方向稳定性的 14 个转动级轴测量,以及来自独立管道的三个说话人解析轴,在三个加载案例(辩论 n = 1000;错误预设 n = 3400;道德设置 n = 3400;每个案例 10-17 材料费用;总共 7800 个样本)中描述了这种失败。测量结果是胡克耦合的($σ= E \cdot \varepsilon$ 模拟),并在负载情况下重现,影响高达 $|r_{rb}| = 0.35$ 辩论;符号结构增加了第二种模式:道德设定案例颠倒了速度和积累块。方差构成分为两种情况:辩论是电荷主导的(类脆性断裂:材料等级决定),错误预设和道德设置是主题主导的(蠕变类:负载决定);比率(2.03 vs 0.13/0.17)取决于估计者,甚至在方向上也存在争议。跨法官可靠性(GPT-4o 与 Haiku 4.5)显示辩论评分对法官而言是稳健的(Cohen 的 $κ= 0.88$),而错误预设评分对法官敏感($κ= 0.36$)——必须报告单一法官基准的警告。这是 Ye 等人的诊断所要求的方法论举措:不依赖于构造体的哪种表面形式的多轴表征。