AMBER端到端强化训练网页Agent仅追加记忆,避免稀疏结果奖励下反复覆写遗失证据与纠错反馈。
沙丘判断:长期操作需要保留失败与纠错证据,只追加记忆值得与反复压缩覆写做同预算比较。
按技术方向追踪论文、模型、开源项目、产品服务与工程实践
AMBER端到端强化训练网页Agent仅追加记忆,避免稀疏结果奖励下反复覆写遗失证据与纠错反馈。
沙丘判断:长期操作需要保留失败与纠错证据,只追加记忆值得与反复压缩覆写做同预算比较。
agentd 以 SQLite 存储状态、动作和回报,检索相似经验后重排候选,并提供 SSH 工具、审批与多模型协作入口。
沙丘判断:运行经验可在不改权重时影响动作选择,但词法基线的演示收益不能外推为真实 LLM 的运维能力。
在一个本地推理后端前按profile锁定模型、提示、采样、输出和上下文规则,记录有效请求配置。
沙丘判断:可采用服务端预算与失败语义,但字节估计不是任意分词器的严格词元上界。
CLIP及视觉语言固定表示;语义锚分布诱导可拟合Bregman几何,在不改表示下按语境重排图像检索。
沙丘判断:已有 CLIP 表示可按语境重新度量,适合先试低成本检索适配再决定是否重训。
SAGA将交互轨迹分级为情节、程序和原则记忆,按适用证据选用并以行动重采样修正失败。
沙丘判断:经验可以逐级抽象成程序与原则,但调用时应保留适用证据以免过度泛化。
按语义类别设定Agent记忆写入置信门槛,对价值信念更严格以减少无依据存储并保持覆盖率。
沙丘判断:价值与信念等高风险信息可以设更高写入门槛,同时跟踪覆盖损失。
长时记忆按主体、政策与生命周期验证检索可采纳性,在匹配必需证据召回条件下追踪提示暴露与披露。
沙丘判断:检索到正确事实仍可能不该使用,主体、政策与生命周期应成为记忆读取条件。
MEMTRIM写入时索引证据、读取时删除重复或冲突内容,减轻查询与记忆部分重叠引发的过度依赖。
沙丘判断:记忆重复和冲突需要在读写两端处理,减少上下文并不自动保留必需证据。
MemCo保留本地环境细节并将可迁移工作流提升至全局记忆,按当前状态与决策阶段路由协作经验。
沙丘判断:本地细节与可迁移流程需要不同存储层,读取时应依据当前任务阶段选择经验。
AgentMemGate在用户画像写入处区分计划、完成和纠正,未决推测不晋升当前事实,并测真实字段匹配失败。
沙丘判断:计划与完成事实应在写入时区分,未决推测直接进入用户画像会持续污染后续回答。
PERSIST按声学身份、语义与时间联合检索多会话语音事件,并重用全双工骨干表征降低查询音频编码开销。
沙丘判断:语音记忆需联合身份与时间检索,复用骨干表征时仍要核验声学身份错误。
以时序环境文本及静动态图连续前缀条件化LLM数值海温预测,避免全文网格序列化并单列规则事后解释。
沙丘判断:数值预测和事后规则解释应分开评价,结构前缀的收益需要按时序隔离验证。
HMED在相同恢复的技能发现状态重跑原与修订Meta-Skill,将修订后果蒸馏为经验而非混淆分支初始优势。
沙丘判断:修订经验比较应从同一状态重跑,避免把分支初始优势误当作技能改进。
DAEDALUS探索者自生可解任务、求解者反复成功验证失败启发式,构建无已有任务与oracle验证器的可复用操作记忆。
沙丘判断:探索经验需经反复求解验证,自生任务有用性仍应在独立下游任务检查。
QRAKEN从实际图数据蒸馏路径频率和文字例至TTQL,生成SPARQL后用确定性词汇与共现检查修订。
沙丘判断:图内统计可约束查询生成,确定性词汇检查应与执行结果验证配合使用。
DSV-Mem评测专业高密视觉资料的版本、权威和状态变化,隔离状态更新数量而非仅长上下文OCR瓶颈。
沙丘判断:版本和权威变化需要专门评测,长上下文 OCR 能力不能替代记忆状态更新。
法律Agent无需更新参数,以经验检索按当前事实程序调整并归纳记忆,再按rubric校验跨角色行动协作。
沙丘判断:无参数更新也需要约束经验适用性,跨角色协作应依据当前事实和程序核验。
MINDSET以不可变会话事件、版本化schema和滞后约束状态迁移替代反复摘要,显式处理历史、冲突及失效知识。
沙丘判断:不可变事件与版本化结构可追踪冲突,状态迁移仍应核验失效知识是否正确撤销。
nanoMuse提出可自托管的跨设备个人Agent运行时,共享对话、可读文件记忆及逐动作Sentinel,区分现有实现和评测/模型路线图。
沙丘判断:共享记忆和逐动作守卫值得参考,已有实现应与未完成的评测路线图分开。
590真实Harness压缩边界配对重放,控制前缀状态评估行为历史预测压缩损害的微弱效果及公开证据不能比较的结论。
沙丘判断:历史信号预测作用有限,压缩策略不宜把微弱关联当作可靠在线决策保证。
Hermes Agent 新插件沿用上一主请求的缓存前缀生成交接摘要,保留最近原文,并在容量、路由或输出检查失败时回退。
沙丘判断:可参考把压缩接到现有缓存的实现;收益取决于同模型路由与前缀命中,应另外核验真实工具轨迹的压缩质量。
本文研究模块接口加LinUCB组合搜索优化固定权重Agent Harness。
沙丘判断:可复用模块池与预算受限搜索;总成本须计入候选搜索,报告节省14.6%不能替代仅推理44.2%
OpenHands 增加由用户提示直接驱动的模型路由,统一 Agent profile 工具及 persona,并扩展会话启动和自动化配置。
沙丘判断:值得复用的是提示、工具与执行环境协同配置;模型路由效果还需按任务质量和实际成本验证。
本文研究单模块消融估计Harness工具指令机制对任务性能与token成本的显著性后剪除冗余。
沙丘判断:Harness迭代应同时做删减实验;用留出集确认节省token后任务成功率是否保留。
本文研究共享向量记忆产生跨用户语义检索泄漏,比较三种隔离并用所有权门控恢复基线。
沙丘判断:多租户记忆必须显式校验检索结果所有权;语义相似或同团队不等于访问授权。
本文研究任意时刻有效配对检验检测自演化饱和并输出较早artifact。
沙丘判断:自演化需要停止准则;减少迭代时应比较封存测试性能而非只看开发增益。
本文以无值元数据测Agent能否识别记忆生命周期与可用性。
沙丘判断:记忆后端应公开状态和属性;读者能力不能弥补存储摘要遗漏的撤销信息。
本文研究不可变记忆trace与依赖图按仓库状态核验历史证据再恢复上下文。
沙丘判断:编码记忆需保留来源与失效检查;旧测试结果不能直接用于已修改仓库。
本文研究程序记忆编译为适应环境且有生命周期的Runtime Guide。
沙丘判断:检索Skill应局部化应用边界与有效期,不能将可读文本直接视为可靠执行。
本文研究时间序列结构化感知状态解耦工具和LLM推理。
沙丘判断:先提取数值证据再回答,证据不足应触发再感知。