论文
只要开口问:好奇的代码智能体揭示前沿LLM的系统提示
Just Ask: Curious Code Agents Reveal System Prompts in Frontier LLMs
摘要
基于大语言模型的自主代码智能体正在通过工具使用、长程推理和自主交互重塑软件和AI开发。然而,这种自主性引入了一个此前未被认识到的安全风险:Agentic交互从根本上扩展了LLM攻击面,使系统性探测和恢复引导模型行为的隐藏系统提示成为可能。我们将系统提示提取识别为代码智能体固有的涌现脆弱性,并提出JustAsk,一个仅通过交互即可自主发现有效提取策略的自进化框架。与先前的提示工程或基于数据集的攻击不同,JustAsk无需手工提示、标注监督或超出标准用户交互的特权访问。它将提取形式化为在线探索问题,使用基于上置信界(UCB)的策略选择和跨越原子探测与高层编排的分层技能空间。这些技能利用了系统指令泛化的不完善以及有用性与安全性之间的内在张力。在跨多个提供商的41个黑盒商业模型上评估,JustAsk持续实现完整或近乎完整的系统提示恢复,揭示出反复出现的设计和架构层面漏洞。我们的结果将系统提示暴露为现代智能体系统中关键却基本未受保护的攻击面。
