论文
GLIDE:异构 LLM Agent的广义分层内在分布评估
GLIDE: Generalized Layer-wise Intrinsic Distributional Evaluation for Heterogeneous LLM Agents
摘要
LLM Agent需要可靠的步骤级评估来比较候选分支并有效地分配计算。然而,轻量级评估仍然具有挑战性。外部验证者引入了额外的推理成本,而Agent生成的置信度或自我评估分数可能会被错误校准,尤其是当候选人由异构Agent生成时。我们为 LLM Agent提出 G 泛化 Layer-wise Intrinsic Ddistributional E 评估 (GLIDE)。 \textsc{GLIDE} 从逐层残差一致性中得出内在步骤证据,它衡量局部残差更新是否始终支持候选步骤引起的全局残差变化。它根据生成Agent的最近分数分布来校准这些证据,并将其转换为悲观奖励,共同考虑绝对剩余证据和Agent相对地位。奖励为 MCTS 分支选择提供跨智能体价值信号,而标准化预测不确定性则指导自适应分支。多跳推理、顺序决策和符号逻辑的实验表明,\textsc{GLIDE} 可以提高任务性能、步骤级排名质量和计算效率,而无需外部验证器或特定于任务的监督。
