论文
训练但不学习:LLM 代理作为前沿部署工程师的后训练交付基准
Trains but Doesn't Learn: A Post-Training Delivery Benchmark for LLM Agents as Forward-Deployed Engineers
摘要
后训练正在成为一种服务 (PTaaS):客户提供操作员数据和目标,前沿部署工程师 (FDE) 根据预算、人工审批门和可重复性要求返回经过微调、评估和部署的模型。让 LLM 代理人担任 FDE 席位提出了一个现有基准无法回答的问题:不是代理人是否可以提高指标,而是代理人是否可以信任其交付。我们在受管理的交付平面上回答这个问题,其中一个代理驱动十个阶段,一个预言机根据平台记录的事实对每个阶段进行评分。核心的无声故障是训练但不学习的运行(TBDL):损失下降,每个信号保持绿色,并且交付的模型并不比基础模型好。操作员运行的验收门会在付款前捕获每一次此类运行,并且根据已知损坏的运行校准的检测器会在运行中标记严重的损坏。我们在 8B 至 70B 开放基础上的计量 L40S、A100 和 H200 GPU 上端到端运行了四个前沿代理(Claude Opus 5、GPT-5.6-luna、Gemini 3.7 Flash、DeepSeek V4-Pro),在评分之前验证每个场景。我们还在同一个预言机下运行了人类 FDE 手臂,并将每个代理与其进行比较。