论文

审计金融智能体的自我进化:能力增益、安全漂移与执行接口失配

Auditing Self-Evolution in Financial Agents: Capability Gains, Security Drift, and Execution-Interface Mismatch

模型评测上下文与知识智能体系统记忆Agent Skills智能体自我改进安全与风险评测Agent记忆

摘要

自我进化智能体将经验转化为可复用的技能、工作流或记忆,但仅凭进化后的准确率并不能说明学到的行为是否保持了此前正确的行为或安全性。我们在模拟电子银行中审计 SkillOpt、Agent Workflow Memory(AWM)与 ReasoningBank,采用匹配的良性获取轨迹、密封评估端点、以执行为依据的检查与独立状态回放。在 Qwen 3.7 Flash 上,SkillOpt 将良性效用从 0.741 提升到 0.837,而注入内容暴露度从 0.820 升至 0.943。暴露后的条件攻击成功率从 0.605 降到 0.562,但总体攻击成功率(ASR)从 0.496 升至 0.530,未授权金融状态变更升至 0.685。在三条独立进化的谱系中,能力、暴露与未授权状态变更在三者中全部上升,而 ASR 仅在两者中上升。ReasoningBank 将效用提高到 0.859 且未增加总体 ASR,但未授权状态变更仍略高于 Static 基线。AWM 则揭示一个单独的评估隐患:字面化的 WebArena 文本动作包络在我们的原生函数调用执行器中破坏工具执行。在一项事后敏感性测试中,仅移除该包络就使效用从 0.319 恢复到 0.756,同时暴露从 0.299 升至 0.909,ASR 从 0.195 升至 0.575。因此,审计自我进化的金融智能体需要跟踪性能回退、攻击面接触、未授权金融状态变更与产物-执行器兼容性,而非只看准确率。