论文
A²utoLPBench:经逆KKT构造的自动生成、智能体友好的LP基准
A$^{2}$utoLPBench: An Auto-Generated, Agent-Friendly LP Benchmark via Inverse-KKT Construction
摘要
多数从文本到线性规划的基准是由人工编写与标注的文字题静态数据集。此类数据集一经发布——规模固定、难度固定、且每道题都可能泄漏进未来LLM的训练数据。我们提出A²utoLPBench——测试LLM驱动智能体求解纯文本线性规划问题的基准。我们先选定一个可行点与对偶——再反推写出一道使该点最优且目标值已知的题目。答案由构造已知——无需调用求解器也无需人工标注。评估环境捆绑参考求解器—评审器基线与一个Docker镜像——其使用说明专为LLM驱动智能体阅读而写。就位后任何智能体可用一条命令运行基准并获得校准分数。因为该基准是生成器而非固定数据集——它拥有固定数据集无法匹配的性质:无限的新题供给、由(n,m)设定的难度旋钮、构造即正确的真值答案、相对人工出题更低的单题LLM侧成本、跨独立批次可重复的分数、以及使用截止后新种子范围时对训练数据泄漏的抗性。
