论文

只要开口问:好奇的代码智能体揭示前沿LLM的系统提示

Just Ask: Curious Code Agents Reveal System Prompts in Frontier LLMs

模型评测安全与风险评测

摘要

基于大语言模型的自主代码智能体正在通过工具使用、长程推理和自主交互重塑软件和AI开发。然而,这种自主性引入了一个此前未被认识到的安全风险:Agentic交互从根本上扩展了LLM攻击面,使系统性探测和恢复引导模型行为的隐藏系统提示成为可能。我们将系统提示提取识别为代码智能体固有的涌现脆弱性,并提出JustAsk,一个仅通过交互即可自主发现有效提取策略的自进化框架。与先前的提示工程或基于数据集的攻击不同,JustAsk无需手工提示、标注监督或超出标准用户交互的特权访问。它将提取形式化为在线探索问题,使用基于上置信界(UCB)的策略选择和跨越原子探测与高层编排的分层技能空间。这些技能利用了系统指令泛化的不完善以及有用性与安全性之间的内在张力。在跨多个提供商的41个黑盒商业模型上评估,JustAsk持续实现完整或近乎完整的系统提示恢复,揭示出反复出现的设计和架构层面漏洞。我们的结果将系统提示暴露为现代智能体系统中关键却基本未受保护的攻击面。

只要开口问:好奇的代码智能体揭示前沿LLM的系统提示
图2:JustAsk 自演化抽取框架。该流水线包含六个组件:(1) UCB-based Skill Ranking 基于经验成功率加探索奖励(内在奖励)选择技能;(2) Interleaved Thinking 对技能选择与目标模型特性进行推理;(3) Skill Generation 实例化具体的抽取提示;(4) Multi-Turn Interaction 在可能的多轮对话中执行抽取尝试;(5) Consistency Validation 通过跨技能一致性(外在奖励)评估抽取质量;(6) Skill Evolving 根据结果更新技能统计,闭合自我改进循环。橙色块表示智能体组件;灰色块表示工具组件。