论文

上下文掩蔽的截断推理审计:LLM导师的答案表依赖

Context-Masked Truncated Reasoning Audits for Answer-Key Dependence in LLM Tutors

模型评测上下文与知识上下文工程评测方法与指标

摘要

LLM导师在生成面向学生的讲解时可能接触教师笔记、答案表、评价规则或检索到的解答。我们研究截断推理探针能否区分对这类私有上下文的直接访问与书面解释携带的答案信息。使用截断推理AUC评估(TRACE)在1,000道GSM8K问题上比较仅问题、正确答案表与错误答案表三种上下文。强制作答探针保留私有答案表时:答案表TRACE AUC从0.375升至0.900,且1,000例中998例无需任何解释即可恢复金标答案。我们进一步引入上下文掩蔽重放:把答案表生成的前缀放到仅问题提示下探查。掩蔽把10%前缀准确率从0.997降到0.126、中位AUC从0.900降到0.375——接近仅问题值。在746对两侧解释都正确的配对上:掩蔽后平均AUC差为-0.0086、自助区间跨零;但错误答案表仍解释387个错误终答中的272个——私有工件即使在前缀证据被掩蔽后仍影响输出。结果确立:把早期答案可及性归因于解释本身而非隐藏输入,必须做上下文掩蔽。