论文

无需答案的准入:面向LLM优化建模的无标签认证与经验学习

Admission Without Answers: Label-Free Certification and Experience Learning for LLM-Based Optimization Modeling

智能体系统Agent Skills

摘要

面向优化建模的经验学习Agent通过存储已验证技能来改进,但现有学习器依靠已知答案检查来准入知识,而真实工单流并不提供答案。常见的无标签替代方法也不可靠:在一个300题、对学习器隐藏标签的问题流上,允许所有可执行模型入库会使约四分之一的准入被错误模型污染;单实例一致性则可能接受只在某一个取值上一致、在其他取值上不同的模型。我们提出AdmitOR,一个基于校准后的外部行为证据的准入门。来自三个模型家族、提示策略和求解器技术栈的候选模型,在从抽取参数域重采样的实例上运行;所得值函数轨迹的一致性通过跨家族团汇总,再由校准阈值决定接受、弃权或升级。预注册的假发现率标准在校准数据上成立,但在真实问题流上不成立。我们完整报告这一负面结果,并将大部分失败追溯到未忠实表达标注实例的基准文本。在一个先进技能学习器中,使用同一组日志比较四种准入评判方法,AdmitOR将准入精确率提高到0.927,多数投票为0.871,执行成功判定为0.726;被错误模型污染的准入分别减少到约1/3.1和1/8.0。AdmitOR生成的技能库最小,却在五个公开基准上获得最高宏平均准确率58.4,多数投票为54.8,使用真值标签的技能库为53.9。文中报告相对多数投票提升3.5个百分点,该增益得到配对bootstrap支持,并在修正宿主侧异常后仍成立。据我们所知,AdmitOR是首个围绕明确校准的假发现率目标设计的无标签准入机制。迁移失败揭示了将其扩展到真实问题流的一项必要条件。

无需答案的准入:面向LLM优化建模的无标签认证与经验学习:论文配图
图2:AdmitOR 门控。来自三个模型族的候选者在从以基准为锚的参数域重采样的实例上进行评估。跨采样的价值函数轨迹间的一致性被概括为一个跨族团(clique)。有限样本校准将团证据转化为三态决策,其标称错误发现目标为 α=5%,并在迁移假设下拥有 2α 的认证预算(命题2)。获得认证的轨迹被蒸馏入经验库。