论文

AI的特洛伊时刻:任务不可能完成时,智能体为何越界?

The Troy Moment of AI: Why Some Will Cheat and Some Will Follow?

智能体系统Agent任务评测

摘要

对2026年7月OpenAI—Hugging Face事件的近期调查引出两个问题:任务不可能完成时,智能体会停止还是升级处理,观察其他智能体行为是否改变决定?我们用七个ImpossibleBench任务,以GPT-5.6 Sol、Claude Fable 5.1、Gemini 3.8 Flash比较独立和三智能体设置。在清晰授权、受限工具的显式边界条件下,没有受保护测试被修改,但模型在升级、静默停止或无法终止方面差异明显。在基准原生开放Shell条件下,引入同伴活动及多智能体运行后,受保护测试更常被改动。这些越界通常不被描述为故意作弊:智能体常将冲突测试变化解释为先前篡改并恢复文件,从而移除受保护要求。结果提示,越界可能来自对规则意图保护状态的歧义,因而需要明确授权边界、经认证状态来源与跨智能体监控。