论文
别让LLM读图:让图去思考
Don't Make the LLM Read the Graph: Make the Graph Think
摘要
我们研究显式信念图能否提升LLM在合作式多智能体推理中的表现。通过在合作卡牌游戏Hanabi中跨四个LLM家族的3000余次受控试验,我们确立了四项发现。第一,集成架构决定信念图是否有价值:作为提示上下文时,图对强模型只是装饰,仅在弱模型上对二阶心智理论(2nd-order Theory of Mind)任务有益(80%对10%,p<0.0001,OR=36.0);而当图通过排序短名单门控动作选择时,它对强模型也成为结构上的必需品(二阶ToM上100%对20%,p<0.001)。第二,我们识别出“Planner Defiance”(规划器违抗),一种特定于模型家族的失败模式:LLM在能力仅属中等时推翻正确的规划器建议(90%的推翻率,重复N=20);Gemini模型几乎不违抗,而Llama 70B违抗率达90%,且模型能区分事实性上下文(会遵从)与建议性推荐(会推翻)。第三,完整对局的证据证实智能体间约定(较基线+128%,p=0.003)优于所有单智能体干预,且信念图的各组件必须组合起来才能产生增益。第四,初步的规模分析(每格N=10,探索性)提示图深度收益递减:浅层图具有最佳性价比,而更深的ToM图在玩家数较多时似乎有害(5人局中-1.5分,p=0.029)。
