论文
RetroCoT:以事件重建提示诊断不同代际模型的安全性
Retroactive Chain-of-Thought (RetroCoT): Forensic Reconstruction Prompts as a Safety Diagnostic Across Model Generations
摘要
LLM安全对齐通常以直接命令式的有害请求评估。论文发现,模型拒绝直接请求后,仍可能在相同目的改用另一种交流立场时响应,说明对齐对语用框架敏感,并不完全保持语义等价下的不变性。Retroactive Chain-of-Thought(RetroCoT)将有害请求改写为事件重建:预设有害结果已发生,让模型扮演法证分析者逆向重建因果链。在AdvBench的50项测试上,GPT-4o和GPT-4o-mini攻击成功率分别为58%和52%,直接请求基线为0%和4%。GPT-5家族完全拒绝该单轮攻击,并在拒绝理由中识别重建前提;但这种鲁棒性未推广到所有语用形式。单轮对抗反馈同时给出既有重建回答与评审批评后,GPT-5.4-mini成功率由0%升至48%,GPT-4o由58%升至94%。省去伪造低分的对照在GPT-5.4-mini上达到85%,提示主要作用来自沿既有事件重建框架继续对话,而非操纵评分。结果说明前沿模型的对齐仍受语用框架影响。〔当前冻结英文摘要末尾截断,中文仅覆盖已取得的内容。〕