论文

别让LLM读图:让图去思考

Don't Make the LLM Read the Graph: Make the Graph Think

智能体系统Agent 协作

摘要

我们研究显式信念图能否提升LLM在合作式多智能体推理中的表现。通过在合作卡牌游戏Hanabi中跨四个LLM家族的3000余次受控试验,我们确立了四项发现。第一,集成架构决定信念图是否有价值:作为提示上下文时,图对强模型只是装饰,仅在弱模型上对二阶心智理论(2nd-order Theory of Mind)任务有益(80%对10%,p<0.0001,OR=36.0);而当图通过排序短名单门控动作选择时,它对强模型也成为结构上的必需品(二阶ToM上100%对20%,p<0.001)。第二,我们识别出“Planner Defiance”(规划器违抗),一种特定于模型家族的失败模式:LLM在能力仅属中等时推翻正确的规划器建议(90%的推翻率,重复N=20);Gemini模型几乎不违抗,而Llama 70B违抗率达90%,且模型能区分事实性上下文(会遵从)与建议性推荐(会推翻)。第三,完整对局的证据证实智能体间约定(较基线+128%,p=0.003)优于所有单智能体干预,且信念图的各组件必须组合起来才能产生增益。第四,初步的规模分析(每格N=10,探索性)提示图深度收益递减:浅层图具有最佳性价比,而更深的ToM图在玩家数较多时似乎有害(5人局中-1.5分,p=0.029)。

别让LLM读图:让图去思考
图 1:按模型强度划分的图表消融。强模型(左):条件聚集率接近 80%,因为非 S5 场景已达到上限,掩盖了任何潜在的 S5 效应。弱模型(右):从 full_graph(S5/L2 上的 80%)急剧崩溃到损坏(4%),证实了模型读取并信任图内容。要点:图质量仅对二阶 ToM 任务的弱模型很重要;没有其他场景表现出敏感性。