论文
AI后训练AI缺失了什么:一项实证分析
What is Missing from AI Post-Training AI: An Empirical Analysis
摘要
大语言模型(LLM)Agent如今可以端到端地对LLM进行后训练:编写代码、启动训练、评估检查点并改善下游性能,使AI辅助AI研发成为可能。但这一描述混淆了两种能力:执行层能力,即在选定训练策略内迭代;策略层能力,即随着实验证据积累而修订高层判断。分析大量公开发布的后训练轨迹后,我们发现,在不同任务上,Agent都在最初就锁定训练策略,并将剩余预算全部用于既定策略内的局部调整。随后,我们通过逐步加强的干预检验三种可能解释:缺少经验、缺少指导以及推理不足。大量实验显示:(1)经验驱动的辅助框架普遍改善执行,在GSM8K和HumanEval上分别提升12.6和40.8个百分点,但策略仍然不变;(2)人工指导能有效改变初始策略,但训练开始后Agent又回到局部调整循环;(3)增加推理计算量在较简单任务上有效,却在最难任务上几乎没有收益。因此,Agent缺少的并非经验、指导或推理算力,而是在执行过程中主动重新评估策略的机制。
