论文
逻辑推理智能体的 Agent 化评估
Agentified Assessment of Logical Reasoning Agents
摘要
我们提出一个评估与基准测试逻辑推理智能体的框架,适用于评估本身必须可复现、可审计且对执行失败稳健的情形。基于 Agent 化评估,我们用评估智能体发布任务、强制执行预算、解析输出并记录结构化失败类型,被测智能体只需暴露标准化的 agent 对 agent 接口。作为案例研究,我们在 FOLIO 经求解器验证与修复的切分上对面向一阶逻辑(FOL)推理的自动形式化智能体进行基准测试。该智能体把自然语言前提与结论翻译为可执行 Z3Py 程序,并运用可满足性模理论(SMT)求解来判定逻辑蕴含。在清洗后的 FOLIO 验证集上,自动形式化智能体在评估协议下取得 86.70% 准确率,超过思维链基线(73.89%)。
