论文
AMTFV:用于LLM自校正的Agentic数学工具流程验证
AMTFV: Agentic Mathematical Tool-Flow Verification for LLM Self-Correction
摘要
大规模语言模型在数学问题解决方面表现出色,但可靠地验证候选答案仍然是一个挑战。现有的代表性方法主要通过自然语言反思或直接生成验证程序来辅助验证,前者可能不支持精确计算,而后者则过早地将数学建模与底层实现耦合。我们提出AMTFV(Agentic Mathematical Tool-Flow Verification)。通过引入Mathematical Tool Flow(MTF)作为中断-执行-恢复接口,AMTFV将验证建模与具体执行分离,通过数学工具箱支持精确计算。具体来说,验证代理首先构建验证流程,将要求可靠执行的数学对象和计算意图编码为MTF请求,并发送给数学工具箱代理。后者解析请求,生成可执行调用,并将它们发送到后端进行精确计算。工具输出支持候选答案的裁决、答案的修订和验证流程的修订。我们在DeepSeek、GPT和Gemini的七个模型配置上对五个具有挑战性的数学推理数据集进行了实验评估。实验结果表明,AMTFV在整体上超越了在本研究中评估的代表性基准;对于单个模型配置,它在平均准确度上超过最强基准模型,最多提高了8.3个百分点,特别是在中等和高验证复杂度的样本上。