FluidPD结合短暂预填充卸载与长期在位worker角色重配,以压力指标改善固定资源下服务SLO。
沙丘判断:固定 GPU 预算下可调角色与短时卸载,部署前需用实际延迟压力验证触发条件。
左右滑动查看全部技术方向 →
| 研究对象 | |||||||||
|---|---|---|---|---|---|---|---|---|---|
FluidPD结合短暂预填充卸载与长期在位worker角色重配,以压力指标改善固定资源下服务SLO。
沙丘判断:固定 GPU 预算下可调角色与短时卸载,部署前需用实际延迟压力验证触发条件。
AMBER端到端强化训练网页Agent仅追加记忆,避免稀疏结果奖励下反复覆写遗失证据与纠错反馈。
沙丘判断:长期操作需要保留失败与纠错证据,只追加记忆值得与反复压缩覆写做同预算比较。
Cascadia将975B MoE驻留11台共享CPU-GPU内存AI PC,定制OpenVINO专家执行及流式并发管线,并拆分吞吐与延迟。
沙丘判断:共享内存集群提供新的大模型部署路径,但并发吞吐与单请求延迟须分别衡量。
MemMux为并行编码Agent提供可验证内存归属、子进程回收、逃逸检测及超额准入,含真实Claude Code运行验证。
沙丘判断:并行度需要依据真实进程资源控制,子进程逃逸和回收应纳入容量管理。
CMM通用循环架构,分离矩阵短期与长期记忆,以Transformer联合读写两者,在算法、上下文学习和循环推理任务对比十类架构。
沙丘判断:短期计算与长期保留分离提供新架构实验路径;当前算法与小规模任务结果尚不足以证明大规模语言训练收益。
SquidAgent用输出token预测并行关键路径与协调开销,继承编排者会话并预先统一约定,再确定性调度是否并行。
沙丘判断:并行不总能省时,输出预测、共享上下文和约定成本应纳入调度判断。
ParanoiaEval用200仓库配对任务仅改变风险处理决定性证据,评测编码Agent过度防御及证据响应,含人工校准判断。
沙丘判断:风险处理应响应决定性证据,最小配对任务可检验过度防御造成的浪费。
ScienceClaw跨23学科持续自演化Agent评测,技能更新须源任务重放复现且独立科学任务改善,控制保留、迁移与成本。
沙丘判断:技能更新需重放可复现并改善独立任务,持续评测应同时跟踪迁移、遗忘与成本。
BOTTLED在时间计算API统一预算下评测Agent将整批任务蒸馏成小模型或程序的能力,区分零样本能力与可摊销产物质量成本。
沙丘判断:单次能力与可摊销产品不同,统一预算下的产物质量和推理成本更接近复用价值。
GameGo把游戏种子扩展为PRD并动态压缩,生成55060开发轨迹和124任务基准用于编码Agent训练。
沙丘判断:任务种子、产品需求和可运行资产结合,比脱离环境的代码问答更接近开发训练。
用类型化工具、持久状态和确定性Hooks治理仪表盘Agent审批/恢复,核冻结DataBrain任务和故障场景。
沙丘判断:审批、恢复与工具类型约束应进入运行时,避免只靠提示维持工作流规则。
CLIP及视觉语言固定表示;语义锚分布诱导可拟合Bregman几何,在不改表示下按语境重排图像检索。
沙丘判断:已有 CLIP 表示可按语境重新度量,适合先试低成本检索适配再决定是否重训。
放疗LLM以schema约束26工具调用,纵向状态与身份验证消融量化跨阶段执行及误派发边界。
沙丘判断:跨阶段医疗工具需要维护身份和状态,单次调用正确不能替代纵向流程验收。
对CLIP和DINO用Transcoder追溯抽象概念的转喻锚电路,以因果干预核视觉概念落地。
沙丘判断:抽象视觉概念的可解释性需追到具体图像锚点,并以干预验证关联是否有因果作用。
SAGA将交互轨迹分级为情节、程序和原则记忆,按适用证据选用并以行动重采样修正失败。
沙丘判断:经验可以逐级抽象成程序与原则,但调用时应保留适用证据以免过度泛化。
AegisFlow以LLM生成修复并在数字孪生影子环境验证后执行,提供故障自愈闭环;性能为作者实验报告。
沙丘判断:自动修复可以先在影子环境执行验证,生产采用仍需核对模拟与实际环境的差异。
EPOCH以类型化证据记忆、主动证伪、准入规则和独立重放治理Agent搜索与优化结果。
沙丘判断:候选结果应按主张强度准入并独立重放,不能把基准提升直接升级成科学发现。
TopoPlanner以胞腔工作流复形表示循环、合流与中间状态,检索闭子复形供LLM规划工具序列。
沙丘判断:包含循环和合流的任务可先结构化,再让模型规划,减少仅靠文本序列丢失依赖。
MOTIVE学习多视角自验证的正确性置信度,推理时据此接受或利用历史重思,减少无效轮次。
沙丘判断:重思机制应学习何时值得调用,多做验证并不保证更准确或更便宜。
SSRFT将安全角色问答合成与验证用于监督微调,比较越狱泛化、prefill攻击及良性过拒绝。
沙丘判断:安全后训练应同时检查攻击迁移和良性过拒绝,避免只优化已知拒绝模板。
离线语音系统比较2—5B指令模型四种量化在Jetson和树莓派上的吞吐、能耗与非洲语言质量。
沙丘判断:端侧方案需按具体设备测能耗与语言质量,不能仅凭参数量选择量化版本。
JIVEAdapter将预训练语言模型多任务低秩更新拆为共享与近正交个体部分,并适配秩及冻结共享先验迁移。
沙丘判断:共享更新可以作为迁移先验,但应保留任务特有方向以降低相互干扰。
在Boltz-2和OpenFold-3去噪坐标上施加局部闭式物理投影,不改权重、无需梯度或额外网络调用。
沙丘判断:轻量闭式约束可补充生成模型,采用前应分别验证物理有效性与结构任务质量。
CuratorMAS以五阶段多Agent协作完成数据探索、在线知识检索、指标计算、过滤及技能演化。
沙丘判断:数据探索、过滤和技能更新应保留计算证据,避免把语言建议误当成已执行清洗。
为企业生成式AI构建选择性OCR、参考评分、确定性结构分块和只读检索评估的数据摄入系统。
沙丘判断:企业检索应先改善文档结构和只读评估,再判断是否需要更复杂的生成环节。
比较轻量通用、推理与代码语言模型在端侧物联网数据模型分类的质量成本,并设置TF-IDF等低成本对照。
沙丘判断:简单分类也应保留低成本基线,推理模型的优势需要覆盖额外延迟和能耗。
源材料约束生成后由具名专家验证教学资源,以两届差分与成绩分位测量判断负担和异质学习收益。
沙丘判断:教学内容验证应由具名专家承担,并检查不同学生群体是否获得相近收益。
按语义类别设定Agent记忆写入置信门槛,对价值信念更严格以减少无依据存储并保持覆盖率。
沙丘判断:价值与信念等高风险信息可以设更高写入门槛,同时跟踪覆盖损失。
让编码Agent在无指定任务奖励的具身数字环境运行30小时,比较13个Agent的自主游戏及技能探索行为。
沙丘判断:没有指定奖励的探索能补充任务成功率评测,但需区分持续活动与有用技能积累。
SPECTRUM在固定信息预算循环代码自蒸馏中调制KV谱,检验正确实现多样性而非仅准确率的保留。
沙丘判断:自蒸馏不能只看正确率;保持有效实现多样性有助于避免反复训练后的模式收缩。