论文
OptArgus:检测基于LLM的优化建模中幻觉的多智能体系统
OptArgus: A Multi-Agent System to Detect Hallucinations in LLM-based Optimization Modeling
摘要
大语言模型(LLM)正被越来越多地用于将自然语言优化问题转化为数学形式化和求解器代码,但与参考目标值吻合并不是可靠正确的检验:一个产物可能在数值上一致,却改变了底层的优化语义。我们将这一问题形式化为优化建模幻觉检测(optimization-modeling hallucination detection),即对问题描述、符号模型和求解器实现进行结构一致性审计。据我们所知,我们开发了首个专门面向优化建模的细粒度幻觉分类体系,涵盖目标、变量、约束和实现层面的失败。我们利用该分类体系设计了OptArgus,一个具有指挥者路由、专项审计员和证据整合的多智能体检测器。为评估这一设定,我们构建了一套包含484个干净产物、1266个受控注入产物和6292个自然LLM生成产物的三部分基准套件。与匹配的单智能体基线相比,OptArgus在干净产物上的误报更少,在受控单错误案例上的首位定位更准确,在自然模型输出上的检测能力更强。这些贡献共同将优化建模幻觉检测转化为一个具体的实证问题,并表明模块化、以分类体系为基础的审计是实现更可靠优化建模的一条可行路径。
