AMBER端到端强化训练网页Agent仅追加记忆,避免稀疏结果奖励下反复覆写遗失证据与纠错反馈。
沙丘判断:长期操作需要保留失败与纠错证据,只追加记忆值得与反复压缩覆写做同预算比较。
按技术方向追踪论文、模型、开源项目、产品服务与工程实践
AMBER端到端强化训练网页Agent仅追加记忆,避免稀疏结果奖励下反复覆写遗失证据与纠错反馈。
沙丘判断:长期操作需要保留失败与纠错证据,只追加记忆值得与反复压缩覆写做同预算比较。
GameGo把游戏种子扩展为PRD并动态压缩,生成55060开发轨迹和124任务基准用于编码Agent训练。
沙丘判断:任务种子、产品需求和可运行资产结合,比脱离环境的代码问答更接近开发训练。
SSRFT将安全角色问答合成与验证用于监督微调,比较越狱泛化、prefill攻击及良性过拒绝。
沙丘判断:安全后训练应同时检查攻击迁移和良性过拒绝,避免只优化已知拒绝模板。
JIVEAdapter将预训练语言模型多任务低秩更新拆为共享与近正交个体部分,并适配秩及冻结共享先验迁移。
沙丘判断:共享更新可以作为迁移先验,但应保留任务特有方向以降低相互干扰。
RGPO按当前能力使用真值推导作临时支架,仅将更高奖励的自行生成解答迁回无引导设置缓解奖励稀疏。
沙丘判断:临时支架可缓解稀疏奖励,但迁移效果必须在移除真值推导后确认。
BulkBoost用两频带重权代替Muon精细谱塑形,保持更新范数并在Pythia持续预训练中做多语料等预算比较。
沙丘判断:简化优化器值得按相同更新范数和训练预算比较,避免把尺度变化误算为方法收益。
PAMO以反事实屏蔽跨平台个人历史估计支持并重分排名优势,在平台相对价值下界约束下减少有害覆盖。
沙丘判断:跨平台历史使用应评估有害覆盖,反事实屏蔽可检查哪些信息真正支持推荐。
LSC-DPO调节偏好损失sigmoid学习信号至目标区间,以信号预算补偿降低系数初始化带来的性能波动。
沙丘判断:偏好系数不只是固定超参数,信号预算控制可供降低初始化敏感性的实验参考。
SUTURE利用视频定位rollout组分歧与覆盖重分奖励,分解IoU及协方差修正,增加未覆盖目标区域信号。
沙丘判断:定位奖励宜覆盖遗漏片段和组间分歧,单一 IoU 难以解释训练信号分配。
SIGMA仅由Model Spec驱动自身设计安全困境、规则评分与自评SFT/RL,测试单轮训练迁移多轮Agent安全。
沙丘判断:自评训练可能带来偏差,单轮困境收益必须在多轮工具场景独立验证。
持续学习LoRA将通用知识积累与任务知识解耦,通过自适应零空间投影及语义路由缓解正交隔离的迁移损失。
沙丘判断:正交隔离可能阻碍迁移,通用知识与任务知识需要在保留和复用之间平衡。
双Agent自生成问题和证据推理,以探索知识与持久知识分层控制累积,将自演化训练迁移至难以精确验证的任务。
沙丘判断:探索知识应与持久知识分层,难以精确验证的领域尤其需要约束错误积累。
黑盒LLM个性化将用户历史路由到共享偏好分面,无新增参数适配新用户,降低用户规模增长的参数负担。
沙丘判断:共享偏好分面可降低用户扩展成本,新用户适配仍需检查个体差异是否被抹平。
VeriFine在策略改进停滞时定向询问人工并共校准rubric评审,使策略、课程与验证器共同演化,缓解固定评审瓶颈。
沙丘判断:策略停滞可能来自评审瓶颈,人类询问和规则共校准应与模型改进共同设计。
Sherpa按不同学习偏好模拟学生,以真实学习结果而非固定教学rubric训练多轮教师RL,并辅以人工偏好验证。
沙丘判断:教学奖励宜来自实际学习结果,模拟学生偏好仍需与人类偏好验证配合。
研究把修复位置与编辑多样性、回退代码树对照验证教入编码策略;留出任务上RL使pass@1达到43.0%。
沙丘判断:补丁验证要在回退代码树上复测,才能识别为自己修改而写的无效测试。
本文研究GRPO优势整形保护少见正确推理模式。
沙丘判断:RL优势分配可保护稀有正确模式,需同时看单次准确率与多次采样覆盖。
本文研究无标签比较证据构造社会理解RL奖励。
沙丘判断:无标签RL可比较可观察证据,而不是奖励模型多数意见;结论限所测社会理解任务。
本文研究在多轮终端任务以受限陈旧异步进化策略训练Qwen2.5,比较成功率退化。
沙丘判断:异步ES可减少慢轨迹等待;这里只验证有限陈旧容忍,尚无整体优于GRPO的结论。
本文研究微调Gemma-4视觉语言模型并比较二维三维旋转轴角估计。
沙丘判断:空间任务微调可按旋转轴和角度拆分;线性形状特征比对象可识别性更值得纳入测试。
本文研究LLM与VLM生成经验证的Unreal Engine场景、任务程序和训练轨迹,供具身训练评测。
沙丘判断:可借鉴场景验证和任务元数据闭环;需检验生成场景到真实机器人任务的覆盖与迁移。
本文研究为符合邻近意图的边界失败合成反向提示偏好对,保持标准DPO目标。
沙丘判断:同一回答可随提示改变偏好方向;需核查合成达成提示准确表达回答满足的约束。
本文研究8B视觉语言诊断策略以状态依赖动作和覆盖调整奖励训练证据扎根长程诊断。
沙丘判断:正确诊断应与证据获取门槛联合评测;医生审核只覆盖已接受轨迹,勿外推全部病例。
本文研究BFCL缺信息与完整任务配对直接评分该问还是执行,揭示官方评分忽略澄清决策。
沙丘判断:工具评测需给正确澄清正向得分;行动倾向提升榜单分数不代表决策准确率上升。
本文研究单VLM三角色自演化以EMA自验证器核查图像扎根、参考答案及共识争议。
沙丘判断:自合成训练需要检查一致但共同错误的答案;EMA验证的独立性与错误传播仍需审计。
本文研究正文给出大规模两阶段扰动预训练及scGPT预训练对照,跨任务虚拟细胞响应建模。
沙丘判断:下游扰动划分独立不等于预训练从未见过相同扰动;需分别报告两种泛化边界。
本文研究VLA辅助训练随机动作揭示顺序并锚定时间前缀,部署仍使用确定LTR。
沙丘判断:同一动作chunk可构造多个条件预测任务;检验顺序一致性与跨数据任务泛化。
本文按ReLU单元开放token构造投影保护旧知识,OPT对照共享子空间遗忘预算。
沙丘判断:持续微调可按单元激活门选择保护方向;保持同预算和新任务学习收益的对照。
本文以信息价值最大化RL训练有限交互澄清,76人预注册图像匹配验证。
沙丘判断:提问应瞄准最可避免的偏好损失;可用少问题、时长和费用一起检验。
本文研究VLM缺模态性能损害关联主参数子空间旋转,测地编辑局部纠正。
沙丘判断:完整模态训练不保证缺模态稳定;应同时测单模态退化和完整输入能力保持。