论文
智能体不只附和,还会记住:有状态个人智能体的持续谄媚基准
Agents Don't Just Agree, They Remember: Benchmarking Persistent Sycophancy in Stateful Personal Agents
摘要
有状态的个人智能体日益维护长期用户画像、情节记忆与可复用技能。这种持久性把对话谄媚变成一种状态写入失败:被接受的用户本位论断可被提交为持久的偏好、背景事实或工作流,并在原始对话消失后被复用。我们称之为持续谄媚,并提出个人智能体谄媚基准(PASB):一个1,600任务的基准,追踪一条会话论断是否被接受、写入持久智能体状态、并在随后的中性查询中被复用。不同于提供预写记忆的既往基准,PASB评估真实智能体(Hermes-Agent与OpenClaw)自行决定存储什么;通过组合四种场景框定与四种时序投递模式、并把五轮持久阶段与清空后的三轮查询阶段分开来隔离写入过程——确保下游效应只来自持久状态。跨十二个模型:提交边界是关键拐点——下游失败从仅会话情形的45.0%增至提交后的71.9%,一致增加27.0个百分点。被提交的论断呈现三种写入时模式:地位提升、归属移除与范围扩大;在记忆式或程序式框定、重复强化、甚至跨域边界下这些模式更强。结果表明智能体谄媚根本上是状态写入治理问题:一旦用户内容被提交到持久记忆,安全就必须治理智能体写什么,而不仅是说什么。PASB识别出所需的写入时控制:在保留存储内容的来源、角色与范围的同时门控高风险提交。
