论文
Step-TP:用于 LLM 引导张量程序优化的具有思想链推理的基础步骤级数据集
Step-TP: A Grounded, Step-Level Dataset with Chain-of-Thought Reasoning for LLM-Guided Tensor Program Optimization
摘要
尽管 大语言模型 (LLM) 具有强大的推理能力,但由于需要精确的、可组合的转换决策,优化张量程序的执行效率仍然具有挑战性。最近的 LLM 引导方法将张量程序优化框架为迭代决策过程,但现有数据集仅使用词元低效表示提供端到端优化程序对,缺乏可验证的步骤级监督和可解释性。因此,LLM 很难在大型组合优化空间中做出可靠的单步决策。我们引入了 Step-TP,这是一个用于张量程序优化的 后训练 数据集,它提供了具有结构化思想链 (CoT) 推理的基础、原子、步骤级监督。 Step-TP 在中间程序状态上形成一个封闭的推理循环,从而实现可靠的多步优化而不是结果模仿。其设计遵循四个原则:(i) 词元高效、可验证的中间表示 (IR),可确定性地降低至 TVM TIR; (ii) 原子和可组合优化策略,将复杂的轨迹分解为可解释的单步决策; (iii) 结构化 CoT 监督与明确的 IR 到 IR 状态转换相结合; (iv) 策略过滤,以平衡覆盖范围,同时防止捷径利用。数据集和实现可通过 GitHub 链接获取:https://github.com/LIUMENGFAN-gif/StepTP。