论文

CrackedPDFs:PDF隐藏提示注入的受控基准

CrackedPDFs: A Controlled Benchmark for Hidden Prompt Injection in PDFs

模型评测安全与风险评测

摘要

基于文档的LLM系统常在护栏检查前先展平PDF。这一步会丢弃“指令从未对用户可见”的证据。我们提出CrackedPDFs,一个PDF隐藏提示注入的受控基准:含从4,983个基础文档生成的29,322个PDF——9,774个注入文件与19,548个良性或匹配混淆文件。我们评估PromptGuard与规则基线,并评估仅结构的学习模型与净化混合检测器。评估使用留出来源划分与配对的良性—混淆对照,并使用标签打乱检查与捷径审计。在2,919文档的留出测试集上,混合检测器达0.960 F1、ROC-AUC 0.998、PR-AUC 0.997;在含973个注入PDF与973个匹配良性混淆的平衡子集上,分类准确率95.9%,按分数排序在973对中100%把注入成员排在匹配混淆之前。仅给抽取文本时PromptGuard召回率低;配对对照下仅结构的学习模型弱;纯文本TF-IDF模型取得完美留出分数但未过捷径审计。这些结果表明文档感知的混合检测在受控配对评估下有用;但不证明广泛的现实世界鲁棒性或可靠的跨家族泛化。

CrackedPDFs:PDF隐藏提示注入的受控基准:论文配图
图 1:威胁模型分类。该分类法将这项工作置于隐藏文档攻击的解析器级和布局级区域中,其中内容可能对人类审阅者不可见,但对下游提取或摄取逻辑可见。