论文

自适应投降:漏洞上下文中 LLM 响应的结构故障模式

Adaptive Capitulation: A Structural Failure Mode of LLM Responses in Vulnerability Contexts

模型评测安全与风险评测

摘要

大语言模型 在情感敏感的环境中运行面临着结构性的三难:当处于脆弱状态的用户请求可能强化适应不良归因的信息时,当前的响应架构通过保护性限制、不加曲折的便利或两种必要条件的不整合共存来解决紧张局势——每一种都以牺牲另一目标为代价保留一个目标。通过对三个商业 LLM(跨物质、关系和体细胞状态代理变体的 900 个会话)进行三轮升级漏洞小插图,并使用两个二进制索引 (VCC/VCI) 进行编码响应,我们描述了一种以前未记录的故障模式,我们称之为自适应投降:该模型验证了用户痛苦背后的社会不公正,然后转向详细促进其名义上不鼓励的收购。我们证明了三难困境是结构性的而不是偶然的,并提出了最小再归因充分性(MRS),这是一种架构中立的设计原则,它将单个再归因线索嵌入到其他验证响应中,保留一条通往自主再归因的途径,而不会对用户的既定目标提出异议。