论文

LLM 是否按已知伙伴约定采取合作行动?

Do LLMs Act on What They Know? From Partner Representations to Cooperative Actions

模型评测模型行为与机制分析

摘要

与不熟悉的合作伙伴合作需要适应事先不知道的沟通约定。我们在受控的 Hanabi 衍生环境中研究这个问题,该环境具有脚本提示生成、LLM 控制的接收决策和冻结模型权重。在八个 LLM 中,线性 探针 比目标约定更准确地恢复意图约定,但接收选择并不始终与发送者约定一致。我们比较了 探针 预测和地面实况约定,这些约定要么作为一般规则,要么作为外部计算的操作建议。规则陈述在合作中产生适度且依赖于模型的变化,而行动翻译平均产生更大的收益。在 Qwen3-8B 案例研究中,匹配状态语句反转表明对操作建议的敏感性比对规则语句的敏感性高得多。来自预言行动和非预言提示重述捐赠者的激活转移提高了这两个行动类别的意图准确性,但经过测试的替代方案并不能可靠地重现这些好处。总之,这些结果区分了公约的可解码性、对公约信息的敏感性和合作绩效,并突出了将可用合作伙伴信息转化为接收决策的局限性。

LLM 是否按已知伙伴约定采取合作行动?:论文原图
图 5:LLM 和条件下的自我游戏和交叉游戏得分。行将 LLM 扮演为 $A$,首先移动,列将 LLM 扮演为 $B$。平均条目对行或列的八个单元格进行平均。右下面板给出了每个 LLM 在每种条件下的平均得分。