论文

将大语言模型作为实时战略智能体评估:限时Risk对局中的厂商表现、混合分解与运营差距

Evaluating Large Language Models as Live Strategic Agents: Provider Performance, Hybrid Decomposition, and Operational Gaps in Timed Risk Play

智能体系统Agent任务评测

摘要

静态基准只能捕捉大语言模型在实际运行中行为的一部分。真实系统将模型置于带时间限制、格式约束和失败模式的重复循环之中。我们在一个具有明确胜利目标和重复规划-执行循环的限时多阶段Risk环境中研究这一设定。在一项规则冻结、重复进行的32局跨厂商锦标赛中,gemini-3.1-pro-preview在与gpt-5.1、claude-opus-4-7和kimi-k2.6的对阵中赢得32局中的20局,且汇总后的胜者分布与等强度零假设差异强烈(p ≈ 1.5 x 10^-5)。随后我们将规划与执行分离,把执行统一到一个更便宜的Gemini Flash底座上。在该设计下,汇总的32局规划器对决与近乎持平相一致(p ≈ 0.821),这表明此前的厂商差距大部分来自端到端系统行为而非规划本身。为研究机制,我们分析了厂商锦标赛中保存下来的规划与执行轨迹。Gemini提及终局目标的频率远高于其他模型,并随胜利临近而加强这种聚焦。Gemini还将更多回合转化为纵深征服链条,尽管它的运行时并非最干净。这些结果表明,实时智能体的表现取决于目标追踪、执行转化、成本与运行时可靠性,并支持将LLM作为有界工作流中的组件来评估,而不是作为孤立的基准答题者。

将大语言模型作为实时战略智能体评估:限时Risk对局中的厂商表现、混合分解与运营差距:论文配图
图7:执行表现摘要:Gemini的运行并非最干净,但仍兼具可接受的可靠性与最强的中盘转化能力。