论文
当幼儿园学生解决微积分时:测量角色提示推理模型中的能力泄漏
When a Kindergartener Solves Calculus: Measuring Capability Leakage in Role-Prompted Reasoning Models
摘要
我们研究了角色能力泄漏(RCL)问题,其中角色提示推理模型生成令人信服的角色内文本,同时继续在基准上展示超出指定角色所暗示的能力。例如,当提示模型扮演幼儿园学生的角色时,人们可能期望其在数学基准上的表现反映幼儿园水平的能力,而不是解决微积分问题的专家水平的熟练程度。我们引入了 RoleCapBench,这是一个基于课程的基准,用于评估六个教育角色和四个评估级别(从小学到 A-level)的 RCL,并用它来评估三个开放权重推理模型。我们发现,尽管这些模型可以生成风格上令人信服的角色内响应,但它们始终无法将其基本能力与其分配的角色保持一致。朴素的角色提示产生了 1.218--1.389 的强大角色语音分数,同时保留了 0.811--0.898 的角色准确度。 RCL 在一系列提示条件下持续存在,包括明确指示模型匹配角色能力级别的提示。为了缓解这个问题,我们提出了注入,这是一种推理时间干预,它将明确的、特定于角色的能力指南与指导性的预填充响应前缀相结合。注入改善了模型之间的角色能力匹配,将角色之上的准确度降低了 0.562,同时保持了角色内的准确度,在大多数模型中边际下降幅度小于 0.058。所有工件,包括脚本和评估数据,将在接受后发布。