论文
LLM智能体多轮一致性评测:生存分析与失败理由分类
Evaluation of Multi-Turn Consistency in LLM Agents: Survival Analysis and Failure-Rationale Taxonomy
摘要
大型语言模型(LLM)智能体可能在孤立任务上表现良好,却在长时交互中漂移为不一致。我们在一个受延迟满足研究启发的受控20步多智能体设置中评估时间一致性。在每一步,智能体选择继续延迟奖励还是立即领取(终止回合)。在社会可见性(私密vs公开)、人格压力源和深思策略的全因子操纵下,我们运行了84,540条轨迹,覆盖8个模型家族。把首次领取奖励作为事件时间结果,我们估计Kaplan-Meier生存曲线并拟合离散时间风险回归,量化实验因素如何随时间改变失败风险。随后,为分析与失败相关的理由和语言模式,我们从选择终止回合的智能体的13,780条深思轨迹构建了一个七类分类法,采用LLM辅助标注配合人工审核(κ=0.83)。理由画像随时间和情境系统性变化:早期失败更多由冲动驱动,后期失败更多以疲劳和成本收益为框架,而公开情境增加规范导向的辩解。我们还发现深思-不一致关联:在失败中,更长的深思与更高的理由内矛盾率相关(同时出现支持延迟和支持领取的陈述),这挑战了推理文本越多越一致的假设。生存与理由分析共同揭示了不同的时间可靠性状态和模型特有的失败指纹,为诊断多轮智能体行为中的不一致提供了评测视角。
