作者|沙丘智库研究团队
来源|沙丘社区(www.shaqiu.cn)
“以后别这么写了。”
“好的,记住了。”
如果经常用AI写东西,你大概知道,第二句话还不能让人放心。有没有记住,得等下一篇再看。
我们希望它记得自己的表达习惯,记得项目已经改过方向,最好连上次试过但没走通的办法也记得。这样每次打开对话,才不用重新介绍一遍背景。
9月4日,英伟达公开了一项基于NemoClaw的记忆型Agent实践。这个面向开发者的示例,会整理人物、项目和工作重点,还把用户对它的纠正保留下来。
新模型发布,我们通常先看它解题、编程、写作的能力有没有提高。但把一项工作连续交给Agent,问题就具体了:前面确认的要求还记不记得,你改过的地方,下次还会不会出错?
这些差别,不一定能从模型榜单上看出来。英伟达这项实践值得关注,也在这里。它尝试让Agent保留此前的工作信息,同时允许用户修改它的判断。
毕竟,AI如果理解错了,也可能把误解一直记下去。这次已经说清楚的事,下次最好别再解释一遍。
01
给AI一本能接着往下写的工作笔记
先想一个常见场景。
周一,你让AI帮忙准备分享,听众是工程师,内容可以深入一些。周三,活动安排调整,听众变成了刚接触AI的同事。周五,你回来接着做讲稿。
如果AI找回了周一的要求,却没接上周三的变化,内容可能写得很专业,但你仍然得返工。
这时,你未必希望它把所有聊天重新复述一遍。你只是希望它知道:听众已经换了。
这个假设场景,可以帮助理解英伟达方案里一份叫作self model的记忆。名字听起来像“自我模型”,在这里,可以先把它理解成一份持续维护的工作笔记,记录与用户有关的人物、事项及其联系。
它与一整段聊天历史的区别,在于经过了整理。谁和哪件事有关,哪些事项还没结束,用户改过什么判断,都要分别记清楚。
但整理也会引入理解上的偏差。因此,方案把原始材料与整理后的认识分开保存:原话留着,AI对原话的理解可以继续修改。
回到分享的例子,“周一曾经面向工程师”可以作为历史留下;“现在面向谁”则需要更新。两条信息并不矛盾,不能因为旧要求出现得更早、讨论得更多,就让它一直占上风。
英伟达给出的整体方案如下。中间的self model,是前面提到的那份工作笔记。

英伟达官方方案示意图。图中列举的是工作信息来源,不代表公开示例已接入全部工具。来源:NVIDIA技术博客。
从左往右看,邮件、文档等工作信息经过整理,成为Agent可以调用的记忆。下方的虚线表示结果与证据会反馈回来,用于后续更新。右侧还单独画出了安全边界:记得某位同事喜欢用Slack,可以帮助Agent建议联系渠道;但能不能替你发消息,仍然要看权限和授权。记住信息,并不等于获得了替你操作的许可。
这种整理有没有帮助?英伟达公布了一组186道题的测试。两组使用同一个Nemotron3Ultra模型,相比能进行多轮检索的Agentic RAG方案,self model方案的总体准确率从82.8%升至90.9%。不过,单跳查询等子项也有下降。
这是官方在特定测试条件下得到的结果,不能推断所有任务都能提升。评测使用了合成资料,配套的离线流程演示也不代表客户实际使用的效果。
值得注意的是,两组并没有换模型。整理和使用历史信息的方式不同,回答就有了差别。Agent最终表现如何,还要看模型拿到了什么信息,以及这些信息是怎样组织起来的。
不过,这里比较的是整套记忆方案,不能把提升全部算到用户纠正功能上。后者要处理的是另一个具体问题:笔记记错了,用户怎么改?
02
你的修改,不能只在这一次生效
假如AI替你整理待办,把一件事排到了前面。你看完说:这件事先放一放。
如果下一轮整理,它又根据同一批材料,把那件事重新顶上来,你的修改就相当于白做了。
在英伟达的示例中,用户可以调整事项的优先级,或者将它标记为忽略。系统会记录这些操作,后续运行仍然保留用户的决定。
方案还会尝试从多次纠正中总结用户偏好。但改过一件事,不能就此认定用户对同类事情都有一样的要求。
公开代码里有个很具体的限制:只有来自用户的纠正,才进入偏好统计。Agent自己调整了排序,不能算作用户又确认了一次。
这条限制不难理解。否则,AI先猜“你不重视这类消息”,随后按照这个猜测调整排序,再把自己的调整当成新证据,就可能越来越确信那个未经确认的猜测。
代码还限制了另一种推断:反复忽略同一个发件人的事项,不能直接推成“这个邮箱域名下所有人的消息都不重要”。个人层面的记录,不应随手扩展成对一群人的判断。
写作时也有类似的区别:
“这篇短一点”,不等于“我以后都只要短文章”。
“不要这个例子”,也不等于“以后不要举例”。
人和人沟通时,也会误会这种意思。放到长期记忆里,问题在于误会可能影响不止一次输出。今天为了省事说的一句话,到了明天,可能成了AI理解你的依据。
所以,那份偏好记录需要允许本人查看、编辑和删除。这里也没有因为几次纠正,就重新训练模型参数;被维护的是模型后续可以读取的一份记录。

这套做法针对的是具体工作场景,不过其中一个要求很普遍:AI理解错了,你得能改得动。
03
经验多了,为什么还会帮倒忙?
有了工作记录,也能记住用户的修改,AI是不是就会用得越久越好?
还有一种情况需要考虑:内容记得没错,却用错了地方。
比如,你让AI帮忙学习编程,希望每一步都展开解释。换到另一项任务,只想让它快速修改一个小问题,如果还沿用那套讲课方式,就会显得啰嗦。
偏好没有消失,任务却换了。
今年7月底,国科大、中科院自动化所、微软和南京大学研究者发表的AgentStream论文,就把不同任务组织成连续任务流,考察Agent积累经验后的表现。
其中一个结果颇有代表性:ACE方法在同一领域连续处理任务时,跨所测模型的平均准确率增益为2.28个百分点;当不同领域任务交错出现时,增益变成了负1.26个百分点。
同一张表里,A-Mem等方法在交错任务中仍然取得了正向收益。论文考察的也不只有狭义的记忆存储,还包括上下文、技能等自演化方法。

上图直接截自论文表5。Isolated指各领域分别形成任务流,Sequential指按领域依次切换,Interleaved指不同领域任务交错出现。前三个数据列是相对基线的平均准确率增益,可按百分点理解;最后两列统计在9组配置中,哪种任务流表现更高。ACE与A-Mem两行可以对照着看:交错任务并没有让所有方法都受损。
因此,这项研究并没有证明“记忆会让AI变笨”。它显示的是:同样在积累经验,方法与任务的搭配不同,结果可以相反。
日常使用AI时,我们也不会一直只做同一种事。上一刻查资料,下一刻写文案,随后又去处理代码。哪些经验可以带过去,哪些应该暂时放下,不能只靠“以前用过”来决定。
而且,任务之外,人的想法也会变化。
刚开始学习时需要详细解释,熟悉之后可能只想看关键差异。项目早期容许快速试错,临近发布又有另一套要求。AI如果一直照顾“过去的你”,未必能服务好现在的你。
一些记忆工具已经支持查看和恢复历史版本。比如,Google Cloud的Memory Bank提供记忆修订记录,开发者可以查看变化,也可以将记忆恢复到之前的版本。它解决的是记录如何修改和恢复,不是自动保证每次理解都正确。
这些实践让我们看到,给AI增加记忆,还得考虑它记下的内容以后怎么更新。
哪些仍然适用,哪些已经过时,哪些只是上一次的特殊要求,都要有机会重新判断。否则,用户说了更多,AI保存了更多,反复解释的工作却未必减少。
04
模型越来越强,为什么还要从头磨合?
一个更强的模型,可能第一次就能写出不错的文章。但你上次为什么删掉那段话,这次为什么换了听众,它未必知道。这些信息来自你们之前的沟通,需要产品把它们保存下来、及时更新,再交给模型使用。
如果每次都要重新交代、重新纠正,那聊天记录即使一条没丢,之前花的沟通时间也没帮我们省下多少事。
从英伟达的纠正记录到Google的记忆修订,开发者已经在为长期使用补上具体功能。至于保留经验之后,Agent会不会表现更好,AgentStream把这个问题放进了连续任务里检验,而结果还要看方法和任务如何搭配。
模型能力依然决定着许多工作能不能做。记忆、更新和纠正,则关系到同一项工作做过几次之后,我们还要付出多少沟通成本。两边都需要进步。
在沙丘智库看来,这也是Agent接下来值得争取的优势:随着使用时间变长,能否让之前的沟通和修改真正帮上忙。用户不需要它每次都表示“我懂了”,更希望下一次不用再改同样的地方。
换上更强的模型很重要。用久之后能让人少操心,同样是Agent该拿出来的本事。
参考资料:
[1] NVIDIA技术博客:Building a Memory-Driven Agent with NVIDIA NemoClaw,2026年9月4日。https://developer.nvidia.com/blog/building-a-memory-driven-agent-with-nvidia-nemoclaw/
[2] NVIDIA官方仓库:Memory-Driven Chief of Staff示例说明,按2026年9月10日可见版本核对。https://github.com/NVIDIA/nemoclaw-community/tree/main/examples/recipes/nvidia/memory-driven-chief-of-staff
[3] NVIDIA官方仓库:Agent Memory Benchmark,评测方法与资料说明。https://github.com/NVIDIA/nemoclaw-community/tree/main/examples/tools/agent-memory-benchmark
[4] NVIDIA官方仓库:preferences.py,用户纠正统计与偏好候选规则,按2026年9月10日可见版本核对。https://github.com/NVIDIA/nemoclaw-community/blob/main/examples/recipes/nvidia/memory-driven-chief-of-staff/profile/scripts/preferences.py
[5] NVIDIA官方仓库:Memory-Driven Chief of Staff设计提案,Issue #122。https://github.com/NVIDIA/nemoclaw-community/issues/122
[6] AgentStream: How Well Do Self-Evolving LLM Agents Perform Under Streaming Tasks? arXiv:2608.00155v1,2026年7月31日,重点参见表5。https://arxiv.org/html/2608.00155v1
[7] Google Cloud官方文档:Memory revisions。https://docs.cloud.google.com/gemini-enterprise-agent-platform/scale/memory-bank/revisions
更多AI研究内容可前往【沙丘智库小程序】搜索查阅