论文
面向CUDA核函数生成中自进化LLM智能体的反馈-规划决策
Towards Feedback-to-Plan Decisions for Self-Evolving LLM Agents in CUDA Kernel Generation
摘要
大语言模型(LLM)作为CUDA核函数生成的自进化智能体已展现出显著的实证收益,这得益于跨代际的以反馈为条件的规划。然而,规划决策如何归因和组合异构的反馈信号仍不透明。标准的端到端消融无法解答这一问题,因为迭代式规划会放大早期扰动,并将反馈效应与依赖轨迹的漂移混为一谈。我们提出CUDAnalyst,一个统一的分析层,通过轨迹冻结与选择性反馈注入,实现将规划决策受控地、代际级地归因于各反馈组件。CUDAnalyst支持稳定的代际级评估,并对反馈效应及其交互进行有原则的联盟式(coalitional-style)归因。我们的结果表明,只有当反馈一致(对齐)时显式规划才有益;有效规划产生于结构化的多反馈交互;来自更强推理模型的高层规划可以部分迁移到较弱的模型。这些趋势在参考骨干模型、代表性工作负载和参考归纳设定下均成立,表明所识别的反馈到规划结构在所研究的受控维度内是稳健的。
