AI技术追踪

免费开放

按技术方向追踪论文、模型、开源项目、产品服务与工程实践

今日重点22条

AI技术动态分布

AI技术追踪库

全部历史
全部历史 · 2,277 条最新发布

AMBER端到端强化训练网页Agent仅追加记忆,避免稀疏结果奖励下反复覆写遗失证据与纠错反馈。

强化学习记忆Agentic RLAgent记忆
Chinmay Savadikar, Zhaoyu Zhang, Mingyu Zhao, Shuang Xie, Han Li, Tianfu Wu, Lingyun Wang

沙丘判断:长期操作需要保留失败与纠错证据,只追加记忆值得与反复压缩覆写做同预算比较。

GameGo把游戏种子扩展为PRD并动态压缩,生成55060开发轨迹和124任务基准用于编码Agent训练。

合成数据
Haoyue Yang, Jingyao Li, Zhengfan Wu, Jing Liu, Xuanle Zhao, Kang Liu

沙丘判断:任务种子、产品需求和可运行资产结合,比脱离环境的代码问答更接近开发训练。

SSRFT将安全角色问答合成与验证用于监督微调,比较越狱泛化、prefill攻击及良性过拒绝。

监督微调与指令调优
Jinghao Pang, Jitai Hao, Qiang Huang, Zhaochun Ren, Jun Yu

沙丘判断:安全后训练应同时检查攻击迁移和良性过拒绝,避免只优化已知拒绝模板。

JIVEAdapter将预训练语言模型多任务低秩更新拆为共享与近正交个体部分,并适配秩及冻结共享先验迁移。

参数高效训练
Sara Abdali, Pashmina Cameron

沙丘判断:共享更新可以作为迁移先验,但应保留任务特有方向以降低相互干扰。

RGPO按当前能力使用真值推导作临时支架,仅将更高奖励的自行生成解答迁回无引导设置缓解奖励稀疏。

强化学习RLVRAgentic RL
Hoang Phan, Minh Pham, Chau Pham, Chinmay Hegde, Trung Le, Qi Lei

沙丘判断:临时支架可缓解稀疏奖励,但迁移效果必须在移除真值推导后确认。

BulkBoost用两频带重权代替Muon精细谱塑形,保持更新范数并在Pythia持续预训练中做多语料等预算比较。

预训练
Meher Chaitanya, Tianyi Zhou, Aristides Gionis

沙丘判断:简化优化器值得按相同更新范数和训练预算比较,避免把尺度变化误算为方法收益。

PAMO以反事实屏蔽跨平台个人历史估计支持并重分排名优势,在平台相对价值下界约束下减少有害覆盖。

强化学习Agentic RL
Yu Xia, Jiangfan Zhang, Jun Xiao, Julian McAuley, Xiangjun Fan

沙丘判断:跨平台历史使用应评估有害覆盖,反事实屏蔽可检查哪些信息真正支持推荐。

LSC-DPO调节偏好损失sigmoid学习信号至目标区间,以信号预算补偿降低系数初始化带来的性能波动。

偏好优化
Yang Qu, Yusheng Han, Chengjia Feng, Handan Liu

沙丘判断:偏好系数不只是固定超参数,信号预算控制可供降低初始化敏感性的实验参考。

SUTURE利用视频定位rollout组分歧与覆盖重分奖励,分解IoU及协方差修正,增加未覆盖目标区域信号。

奖励建模与过程监督
Youngjae Cho, Won Young Jhoo, Jongsuk Kim

沙丘判断:定位奖励宜覆盖遗漏片段和组间分歧,单一 IoU 难以解释训练信号分配。

SIGMA仅由Model Spec驱动自身设计安全困境、规则评分与自评SFT/RL,测试单轮训练迁移多轮Agent安全。

强化学习智能体自我改进Agentic RL
Jingyu Zhang, Shruti Palaskar, Daniel Khashabi, Benjamin Van Durme, Leon A. Gatys, Joseph Yitan Cheng

沙丘判断:自评训练可能带来偏差,单轮困境收益必须在多轮工具场景独立验证。

持续学习LoRA将通用知识积累与任务知识解耦,通过自适应零空间投影及语义路由缓解正交隔离的迁移损失。

持续学习
Maoqi Liu, Quan Fang, Yufei He

沙丘判断:正交隔离可能阻碍迁移,通用知识与任务知识需要在保留和复用之间平衡。

双Agent自生成问题和证据推理,以探索知识与持久知识分层控制累积,将自演化训练迁移至难以精确验证的任务。

强化学习智能体自我改进Agentic RL
Xilin Dang, Weilin Ruan, Xue Yang, Jinghao Wang, Xiaowei Hu, Jinpeng Li, Pheng-Ann Heng

沙丘判断:探索知识应与持久知识分层,难以精确验证的领域尤其需要约束错误积累。

黑盒LLM个性化将用户历史路由到共享偏好分面,无新增参数适配新用户,降低用户规模增长的参数负担。

偏好优化
Hun Park

沙丘判断:共享偏好分面可降低用户扩展成本,新用户适配仍需检查个体差异是否被抹平。

VeriFine在策略改进停滞时定向询问人工并共校准rubric评审,使策略、课程与验证器共同演化,缓解固定评审瓶颈。

强化学习智能体自我改进Agentic RL
Zewei Zhou, Rachel Luo, Yulong Cao, Chaowei Xiao, Chensheng Peng, Boyi Li, Thomas Tian, Zheng Lian, Yan Wang, Jiaqi Ma, Boris Ivanovic, Marco Pavone, Wenhao Ding

沙丘判断:策略停滞可能来自评审瓶颈,人类询问和规则共校准应与模型改进共同设计。

Sherpa按不同学习偏好模拟学生,以真实学习结果而非固定教学rubric训练多轮教师RL,并辅以人工偏好验证。

强化学习Agentic RL
Weixian Xu, Yanzhe Zhang, Zora Zhiruo Wang, Changyu Chen, Diyi Yang

沙丘判断:教学奖励宜来自实际学习结果,模拟学生偏好仍需与人类偏好验证配合。

研究把修复位置与编辑多样性、回退代码树对照验证教入编码策略;留出任务上RL使pass@1达到43.0%。

强化学习RLVRAgentic RL
Muhammad Ahmed Mohsin; Myeongsoo Kim; Kangrui Ruan; Shweta Garg; Varun Kumar; Murali Krishna Ramanathan

沙丘判断:补丁验证要在回退代码树上复测,才能识别为自己修改而写的无效测试。

本文研究GRPO优势整形保护少见正确推理模式。

强化学习
Hangzhan jin; Mohammad Hamdaqa; Doina Precup

沙丘判断:RL优势分配可保护稀有正确模式,需同时看单次准确率与多次采样覆盖。

本文研究无标签比较证据构造社会理解RL奖励。

强化学习
Keane Ong; Yuriel Ryan; Sabri Boughorbel; Vladimir Necula; Jack Wei Lun Shi; Rui Mao; Roy Ka-Wei Lee; Adriel Kuek; Nancy F. Chen; Erik Cambria; Gianmarco Mengaldo; Paul Pu Liang

沙丘判断:无标签RL可比较可观察证据,而不是奖励模型多数意见;结论限所测社会理解任务。

本文研究LLM与VLM生成经验证的Unreal Engine场景、任务程序和训练轨迹,供具身训练评测。

合成数据
Kabir Swain; Sijie Han; Antonio Torralba

沙丘判断:可借鉴场景验证和任务元数据闭环;需检验生成场景到真实机器人任务的覆盖与迁移。

本文研究为符合邻近意图的边界失败合成反向提示偏好对,保持标准DPO目标。

偏好优化
Junbo Wang; Lidong Lu; Zhuoqun Li; Guiping Jiang; Xiangyu Wu; Tinghai Zhang; Tong Lu

沙丘判断:同一回答可随提示改变偏好方向;需核查合成达成提示准确表达回答满足的约束。

本文研究8B视觉语言诊断策略以状态依赖动作和覆盖调整奖励训练证据扎根长程诊断。

强化学习Agent任务评测Agentic RL长程任务评测
Wenxin Zhan; Yizheng Jiao; Haifeng Song; Shuai Xu; Chencheng Pan; Jiayi Feng; Anjie Xie

沙丘判断:正确诊断应与证据获取门槛联合评测;医生审核只覆盖已接受轨迹,勿外推全部病例。

本文研究单VLM三角色自演化以EMA自验证器核查图像扎根、参考答案及共识争议。

合成数据
Youngwan Lee; Yong-Ju Lee; Sung Ju Hwang

沙丘判断:自合成训练需要检查一致但共同错误的答案;EMA验证的独立性与错误传播仍需审计。

本文研究正文给出大规模两阶段扰动预训练及scGPT预训练对照,跨任务虚拟细胞响应建模。

预训练
Yuwei Miao; Azim Dehghani Amirabad; Scott Oloff; Junzhou Huang; Tianyu Cui; Rui Liao

沙丘判断:下游扰动划分独立不等于预训练从未见过相同扰动;需分别报告两种泛化边界。

本文研究VLA辅助训练随机动作揭示顺序并锚定时间前缀,部署仍使用确定LTR。

监督微调与指令调优
Yanqiao Chen; Yuhan Rui; Dongsheng Hou; Zijie Nie; Yutong Wan; Qi Hao

沙丘判断:同一动作chunk可构造多个条件预测任务;检验顺序一致性与跨数据任务泛化。

本文以信息价值最大化RL训练有限交互澄清,76人预注册图像匹配验证。

强化学习Agentic RL
Pranav M R; Manuel Cherep; Pattie Maes; Nikhil Singh

沙丘判断:提问应瞄准最可避免的偏好损失;可用少问题、时长和费用一起检验。

本文研究VLM缺模态性能损害关联主参数子空间旋转,测地编辑局部纠正。

模型编辑与遗忘
Songyuan Sui; Zhen Tan; Mohan Zhang; Rana Muhammad Shahroz Khan; Xia Hu; Tianlong Chen

沙丘判断:完整模态训练不保证缺模态稳定;应同时测单模态退化和完整输入能力保持。