论文

面向CUDA核函数生成中自进化LLM智能体的反馈-规划决策

Towards Feedback-to-Plan Decisions for Self-Evolving LLM Agents in CUDA Kernel Generation

模型评测模型行为与机制分析

摘要

大语言模型(LLM)作为CUDA核函数生成的自进化智能体已展现出显著的实证收益,这得益于跨代际的以反馈为条件的规划。然而,规划决策如何归因和组合异构的反馈信号仍不透明。标准的端到端消融无法解答这一问题,因为迭代式规划会放大早期扰动,并将反馈效应与依赖轨迹的漂移混为一谈。我们提出CUDAnalyst,一个统一的分析层,通过轨迹冻结与选择性反馈注入,实现将规划决策受控地、代际级地归因于各反馈组件。CUDAnalyst支持稳定的代际级评估,并对反馈效应及其交互进行有原则的联盟式(coalitional-style)归因。我们的结果表明,只有当反馈一致(对齐)时显式规划才有益;有效规划产生于结构化的多反馈交互;来自更强推理模型的高层规划可以部分迁移到较弱的模型。这些趋势在参考骨干模型、代表性工作负载和参考归纳设定下均成立,表明所识别的反馈到规划结构在所研究的受控维度内是稳健的。

面向CUDA核函数生成中自进化LLM智能体的反馈-规划决策:论文配图
(a) IntervenePipe 的事件驱动工作流程(b) 单个管道的异步、无序执行时间线。橙色对角阴影表示执行路径没有进一步就绪事件的静止期;其他示例可能会继续并发执行。图 25:IntervenePipe 执行模型。 (上)以样本为中心、事件驱动的工作流程,其中完成事件触发反馈构建、LLM 提示和评估。 (下)一个代表性的时间线,说明了扇出并行评估和无全局同步的无序样本进展。