AI技术追踪

免费开放

按技术方向追踪论文、模型、开源项目、产品服务与工程实践

今日重点22条

AI技术动态分布

AI技术追踪库

全部历史
全部历史 · 5,619 条最新发布

MemMux为并行编码Agent提供可验证内存归属、子进程回收、逃逸检测及超额准入,含真实Claude Code运行验证。

Agent任务评测模型部署长程任务评测
Sumanyu Muku

沙丘判断:并行度需要依据真实进程资源控制,子进程逃逸和回收应纳入容量管理。

SquidAgent用输出token预测并行关键路径与协调开销,继承编排者会话并预先统一约定,再确定性调度是否并行。

Agent 协作
Yexiong Lin, Shanshan Ye, Yu Yao, Zhen Fang, Bo Han, Tongliang Liu

沙丘判断:并行不总能省时,输出预测、共享上下文和约定成本应纳入调度判断。

ParanoiaEval用200仓库配对任务仅改变风险处理决定性证据,评测编码Agent过度防御及证据响应,含人工校准判断。

Agent任务评测
Hanjun Luo, Xiucheng Zhang, Zhuoning Xu, Zhimu Huang, Yingbin Jin, Xinfeng Li, Hanan Salam

沙丘判断:风险处理应响应决定性证据,最小配对任务可检验过度防御造成的浪费。

ScienceClaw跨23学科持续自演化Agent评测,技能更新须源任务重放复现且独立科学任务改善,控制保留、迁移与成本。

Agent任务评测Agent Skills智能体自我改进长程任务评测
Mingda Zhang, Wenjin Liu, Tiesunlong Shen, Zikai Xiao, Zhenghong Lin, Qing Xu, Erik Cambria, Xiaoying Tang, Haoran Luo

沙丘判断:技能更新需重放可复现并改善独立任务,持续评测应同时跟踪迁移、遗忘与成本。

BOTTLED在时间计算API统一预算下评测Agent将整批任务蒸馏成小模型或程序的能力,区分零样本能力与可摊销产物质量成本。

Agent任务评测
Ankit Sonthalia, Haritz Puerto, Alexander Rubinstein, Martin Gubri, Seong Joon Oh

沙丘判断:单次能力与可摊销产品不同,统一预算下的产物质量和推理成本更接近复用价值。

SoulsBench 用统一战斗状态、16种动作和200ms决策预算比较决策模型,记录超时、执行回退、成本与逐回合结果。

判别式推理与决策Agent任务评测Jev
AWoLnik

沙丘判断:实时决策评测需要同时记录延迟、回退和环境随机性;同一 adapter seed 并不能固定游戏运行。

独立 Herald OS alpha 项目公开桌面壳、Hermes 系统工具桥和分层权限审计,实现本机应用、文件与任务操作。

Agent HarnessAgent Runtime
iamlukethedev

沙丘判断:系统工具权限需要在执行桥中落地,同时检查旁路终端;桌面壳本身不提供完整安全隔离。

放疗LLM以schema约束26工具调用,纵向状态与身份验证消融量化跨阶段执行及误派发边界。

Agent 工具调用
Caiwen Jiang, Shuoyang Wei, Songlin Zhao, Junyu Li, Jingyuan Chen, Wei Liu

沙丘判断:跨阶段医疗工具需要维护身份和状态,单次调用正确不能替代纵向流程验收。

AegisFlow以LLM生成修复并在数字孪生影子环境验证后执行,提供故障自愈闭环;性能为作者实验报告。

Agent 动作执行与治理
Muhammad Bilal Awan, Zubair Hussain, Abdul Shahid

沙丘判断:自动修复可以先在影子环境执行验证,生产采用仍需核对模拟与实际环境的差异。

EPOCH以类型化证据记忆、主动证伪、准入规则和独立重放治理Agent搜索与优化结果。

Agent 动作执行与治理
Binjie Guo, Aisheng Mo, Ruitong Li, Xinle Deng

沙丘判断:候选结果应按主张强度准入并独立重放,不能把基准提升直接升级成科学发现。

TopoPlanner以胞腔工作流复形表示循环、合流与中间状态,检索闭子复形供LLM规划工具序列。

Agent 规划
Sen Zhao, Jia Tang, Ruiqi Kong, Zuyu Zhang, Lifeng Shen, Ding Zou, Xinyu He, Xu Zhang, Junwei Han

沙丘判断:包含循环和合流的任务可先结构化,再让模型规划,减少仅靠文本序列丢失依赖。

CuratorMAS以五阶段多Agent协作完成数据探索、在线知识检索、指标计算、过滤及技能演化。

Agent 协作
Yixin Zhang, Wenjie Feng

沙丘判断:数据探索、过滤和技能更新应保留计算证据,避免把语言建议误当成已执行清洗。

v1 PDF明确使用固定mpnet/e5语义编码器审计行动与政策关系及行动前治理;检索到全部治理政策仍不能正确决定许可行动,图结构为后续假设。

Agent 动作执行与治理
Thomson D. Nguy

沙丘判断:找对政策不等于理解例外与行动后果;全量升级审查的负结果提示先验收允许、阻止和转交判断,再设计治理图。

Nerveplane预先按声明范围划分并行编码工作并按依赖排序合并,以真实Git合并而非单Agent测试验证协调。

Agent 协作
Sumanyu Muku

沙丘判断:单个分支通过测试不保证联合修改可合并,真实 Git 合并应成为调度验收的一部分。

Trust Layer独立验证得分依据、计算轨迹、完成声明与重跑稳定性,固定规则裁决且不修改原基准分。

Agent任务评测
Mohammadreza Sediqin, Shivali Dalmia, Srinivasa Karthikeya Reddy Kovvuri, Abhishek Mukherji

沙丘判断:完成声明与计算得分需要独立核验,重跑稳定性应与原基准分数分开报告。

长时记忆按主体、政策与生命周期验证检索可采纳性,在匹配必需证据召回条件下追踪提示暴露与披露。

记忆Agent任务评测Agent记忆长程任务评测
Zi Wang, Xingqiao Wang, Emmanuel Addai, Devika Ambekar, Xiaowei Xu

沙丘判断:检索到正确事实仍可能不该使用,主体、政策与生命周期应成为记忆读取条件。

2D-FET-Bench提供显微薄片器件布局任务与确定性几何校验,比较LLM Agent脚手架及专家审计的真实设计合格率。

Agent任务评测长程任务评测
Dunzhi Zhou, Chengyu Zhu, Gang Qiu, Caiwen Ding

沙丘判断:几何验收和专家审计可约束设计幻觉,模型生成布局仍需满足实际制造条件。

将Agent声明变为预先固定政策、范围、记录责任与裁决规则的可审计主张,论证独立覆盖、逐参数授权及完整性要求。

Agent 动作执行与治理
Yue Zhao, Jiate Li, Li Li, Yi Nian, Jinbo Liu, Xiaolin Zhou, Xiyang Hu

沙丘判断:可审计性要求预先固定范围和责任,输出一份日志不足以证明覆盖与授权完整。

PsyCIDRA让访谈Agent维护笔记、技能与ICD检索,另一Agent综合支持冲突及缺失证据给专家审查,含独立人类研究。

Agent 协作
Milad Mohammadi, Fatemeh Akrami Shamsabadi, Zahra Mohseni, Amirhossein Safdarian, Malekfarhad Malek, Hadi Moradi, Hesham Faili

沙丘判断:访谈记录应保留冲突和缺失证据,模型综合判断仍需专家核验而非直接诊断。

DeOrch将无worker身份任务分解与协作选择解耦,用行为探针和在线bandit匹配未见worker池而不重训规划器。

Agent 协作
Xinle Wu, Yao Lu

沙丘判断:规划器与执行者池分离可减少重训需求,行为探针需随实际工具能力更新。

BioStudyBench选择模型声明截止日期后的生物研究,限制文献工具时间并对照无数据工具基线,检验真实分析增益。

Agent任务评测长程任务评测
David Li, Shaamil Karim, Christian Gensbigler

沙丘判断:数据工具增益应与无数据基线比较,时间限制可减少记忆答案冒充科学分析。

科学发现协议先让LLM提出假说、程序规划有限测量,再新上下文归纳规律,比较解释器、随机采集及覆盖。

Agent 规划
Kautik Mandve, Dileepa Fernando

沙丘判断:测量规划和规律归纳分开可减少自我确认,有限预算下需加入随机采集对照。