论文

从原子到Agentic:迈向LLM智能体数学能力的可解释评估

From Atomic to Agentic: Towards Interpretable Evaluation of LLMs' Agentic Mathematical Capabilities

智能体系统Agent任务评测

摘要

大语言模型(LLM)正从执行端到端数学推理演进为融合agentic智能。然而,现有数学基准大多只评估最终答案。这种以结果为导向的评估对识别过程层面的失败或严谨逻辑的诊断价值有限,难以指导LLM转变为稳健的智能体。为弥合这一差距,我们提出一个过程级基准,旨在评估LLM内在的agentic数学推理能力。我们的框架将解题agentic行为与可复用数学原子能力的结构化分类体系对齐。我们设计了覆盖文本和多模态场景的规划、行动与反馈任务完整套件,并由自动化流水线支持,该流水线合成高质量轨迹并通过受控LLM改写生成细粒度标注。实验揭示,端到端准确率相近的模型可能表现出显著不同的agentic能力画像。这表明过程级评估对于解读LLM的真实潜力和指导下一代数学智能体的开发至关重要。

从原子到Agentic:迈向LLM智能体数学能力的可解释评估:论文配图
图1:展示智能体行为与数学原子能力之间的对齐,从而支持对 LLM 智能体智能的可解释评估。