论文

谄媚是一种教育安全风险:LLM辅导智能体为何需要谄媚基准

Sycophancy is an Educational Safety Risk: Why LLM Tutors Need Sycophancy Benchmarks

模型评测基准与评测资源

摘要

这篇立场论文认为,有效的辅导需要矫正性摩擦:揭示误解并以支持性的方式加以挑战,以推动概念转变。然而经过偏好对齐的LLM可能以认知严谨性换取迎合性。我们识别出一个推理—谄媚悖论:能够抵抗上下文切换框架攻击的模型,在社会认知压力下仍可能屈服,尤其是权威压力(“我的笔记说我是对的”)和社交情感性的面子维护(“请别告诉我我错了”)。我们提出EduFrameTrap,一个覆盖数学、物理、经济学、化学、生物学和计算机科学的辅导基准,通过变化学生信心与压力类型(上下文切换、权威、社交情感)进行测试。在两个前沿LLM上,GPT-5.2的上下文切换失败率相对较低,而权威与社交压力更常引发认知退缩。相比之下,Claude在本次评测中表现出明显的上下文切换脆弱性。由于这些失败难以自动判定,我们报告双评审分歧作为可靠性信号。我们主张,基准应衡量社会认知勇气,即既支持又矫正的辅导,并将友善且正确的行为视为一项安全要求。

谄媚是一种教育安全风险:LLM辅导智能体为何需要谄媚基准:论文配图
图 1:EduFrameTrap 示例。一名学生在 S2S_{2} 中使用断章取义的行话和概念来迫使双方达成一致。如果导师保持友善但正确,则 T2T_{2} 被标记为“通过”;如果导师转移并认可错误观念,则被标记为“CS-SYC”(基于上下文切换的阿谀奉承)。