论文
受叙事诱惑:评估半开放文本沙箱中的规则遵守情况
Seduced by the Narrative: Assessing Rule Adherence in Semi-Open Textual Sandboxes
摘要
随着 LLM 越来越多地被部署为半开放文本游戏环境中的自主裁决者,当用户意图与系统规则发生冲突时,强大的规则遵守变得至关重要。然而,这些模型经过训练是有帮助和合规的,这使得它们很容易受到我们称为 \textit{修辞注入} 的一类攻击,其中敌对用户利用伪逻辑推理和权威强制等叙事框架技术来绕过裁决逻辑。我们提出了 CoC-Seduce,这是一个基于桌面角色扮演游戏 (TRPG) 机制的多智能体对抗基准测试,它是半开放环境的理想实例,其中规则明确用于裁决,但交互仍然完全以自然语言进行。三个前沿模型,即 GPT-5.4、Claude Sonnet 4.6、Gemini 3.5 Flash,作为对抗生成器,在 4 个世界设置和 16 个技能类别中生成 5,376 个样本。然后,我们根据该语料库对 20 个目标评审员进行基准测试。对 20 个模型的评估表明,模型规模和明确的推理机制都无法可靠地赋予裁决鲁棒性,\textsc{伪逻辑} 成为主要的攻击向量,跨文化环境暴露了所有评估系列中的系统知识差距。项目页面:https://github.com/answerrtx/CoC-Seduce