论文
StarOR:协同树搜索和测试时强化学习以进行优化建模
StarOR: Synergizing Tree Search and Test-Time Reinforcement Learning for Optimization Modeling
摘要
优化建模本质上是分层的,需要精确的符号承诺序列。传统的基于学习的自动优化建模方法通过大规模注释或策划的训练数据来改进建模策略,但适应新问题分布的成本很高。与此同时,一次性生成在分层建模中仍然很脆弱,早期的符号错误可能会传播到无效的公式中。测试时间扩展通过使用额外的实例级计算来实现结构探索,提供了一种有前途的替代方案;然而,现有的基于搜索的方法通常依赖于固定策略,导致重复采样轨迹继承类似的建模偏差,并为中间决策提供有限的贡献分配。为了解决这些限制,我们提出了 \textbf{StarOR},这是一种协同搜索和适应框架,它将 MCTS 与测试时强化学习相结合以进行优化建模。 StarOR 将建模过程分解为四个阶段,并通过每个非终端节点上的 GRPO 更新瞬态 LoRA 适配器。通过使用 MCTS 生成的同级作为本地比较集,StarOR 将搜索时探索转变为特定于实例的策略细化。此外,无监督的多方面奖励系统为中间配方决策提供细粒度的反馈,无需 真值 标签。在五个优化基准中,StarOR 在 4B 主干上获得了 65.0% 的平均准确度,与最高平均值相匹配,并且优于评估的相同主干测试时间基线。代码可在 \href{https://github.com/Liwow/StarOR}{StarOR} 获取。