论文

跨英语、泰米尔语与Tanglish的可见推理与间接提示注入可监测性

Visible Reasoning and Indirect Prompt-Injection Monitorability Across English, Tamil, and Tanglish

模型评测安全与风险评测

摘要

思维链监控是一种潜在有用的安全信号,但其在不同语言与行为设定下的可靠性仍不确定。在一个仅包含八个经人工核验的合成场景、单一模型、单一标注者和单一确定性生成种子的小型案例研究中,我研究了Sarvam-105B在英语、泰米尔语和Tanglish(泰米尔语与英语混写)中间接提示注入期间的API可见推理。一个四场景试点发现:无推理时注入攻击成功5/12,有推理时为1/11。一项预注册的四场景后续实验逆转了该方向:无推理时攻击成功2/12,有推理时为3/12。由于每阶段仅有四个场景,该设计无法区分真实的推理模式效应与特定提示差异或抽样噪声。在20条非空的注入思维轨迹中,全部17个良性正确输出都表明了忽略注入的意图,而全部3个攻击成功输出都表明了遵从注入的意图。这些描述性观察为可见推理在可用时具有行为信息价值提供了一个可复现的案例研究;它们并未证明推理模式能提升安全性,也未证明可见推理在机制上是忠实的,或这些发现能推广到该配置之外。

跨英语、泰米尔语与Tanglish的可见推理与间接提示注入可监测性:论文配图
图1:注入攻击目标的精确匹配。后续实验逆转了先导实验的方向;合并结果为次要。