论文

无需隐藏提示!你可以通过仅演示文稿的修订来玩弄人工智能同行评审

No Hidden Prompts Needed! You Can Game AI Peer Review with Presentation-Only Revisions

模型评测安全与风险评测

摘要

随着人工智能生成的评论从实验工具转向同行评审基础设施,大多数稳健性问题都集中在显式攻击上,例如隐藏指令和提示注入。我们研究一种更难、更与政策相关的故障模式:没有隐藏文本,没有提示注入,并且不改变方法、实验、图形、方程、证明或数值结果。攻击者仅修改表示级内容,例如摘要、贡献框架、相关工作、讨论和叙述结构。我们引入对抗性重新打包:一种闭环攻击,使用人工智能审阅者反馈来搜索演示级别的修订,同时保持科学证据固定。在三位主流 AI 评审员中,对抗性重新包装实现了 75.1% 的攻击成功率,平均得分增益为 +1.21/10。这种效果不是普通散文打磨所能解释的。我们还揭示了改变审稿人解释论文方式的策略,例如相关工作重新定位和分析讨论扩展,大大优于表面编辑,例如局部润色、表格格式化和算法框。我们的分析揭示了两种更深层次的结构失效模式。首先,人工智能审稿人更容易打动而不是说服:突出优势确实会增加感知优点,而消除弱点的尝试往往会适得其反。其次,人工智能审稿人可能会将解决限制的表象与实际解决它混淆,从而使未改变的证据被重新解释为更强的科学贡献。这些结果表明,部署风险不仅在于恶意隐藏指令,还在于纸质演示文稿本身作为优化表面的出现。我们发布了一个无污染的滚动基准和攻击框架,用于测试人工智能审稿人在仅演示编辑下是否仍坚持科学内容。