论文

A²utoLPBench:经逆KKT构造的自动生成、智能体友好的LP基准

A$^{2}$utoLPBench: An Auto-Generated, Agent-Friendly LP Benchmark via Inverse-KKT Construction

智能体系统Agent任务评测

摘要

多数从文本到线性规划的基准是由人工编写与标注的文字题静态数据集。此类数据集一经发布——规模固定、难度固定、且每道题都可能泄漏进未来LLM的训练数据。我们提出A²utoLPBench——测试LLM驱动智能体求解纯文本线性规划问题的基准。我们先选定一个可行点与对偶——再反推写出一道使该点最优且目标值已知的题目。答案由构造已知——无需调用求解器也无需人工标注。评估环境捆绑参考求解器—评审器基线与一个Docker镜像——其使用说明专为LLM驱动智能体阅读而写。就位后任何智能体可用一条命令运行基准并获得校准分数。因为该基准是生成器而非固定数据集——它拥有固定数据集无法匹配的性质:无限的新题供给、由(n,m)设定的难度旋钮、构造即正确的真值答案、相对人工出题更低的单题LLM侧成本、跨独立批次可重复的分数、以及使用截止后新种子范围时对训练数据泄漏的抗性。

A²utoLPBench:经逆KKT构造的自动生成、智能体友好的LP基准:论文配图
图 1:构建管道比较以及 A2utoLPBench 的动机。左:传统的 LP 基准需要三个协调的人类角色(教师/学生/编码员)。右图:A2utoLPBench 用反向 KKT 例程、LLM 驱动的自然语言 (NL) 绘图器以及可在任何种子和维度上流式传输实例的自动化层来取代它们,从而消除了每个项目的人工劳动并使供应和难度分布可编程。