论文

迈向智能体化的基于智能体模型:可行性、性能与统计模型检验

Towards Agentic Agent-based Models: Feasibility, Performance, and Statistical Model Checking

模型评测模型能力评测

摘要

基于智能体的模型(ABM)依赖简单、显式、可复现的个体决策规则,复杂的集体行为从智能体交互中涌现。大语言模型(LLM)的近期进展诱使人们用LLM智能体能力替换、丰富或扰动这些规则。但这引出方法论问题:引入LLM驱动的决策会如何影响ABM仿真的可靠性、计算成本与行为?我们在流行的Python ABM库Mesa上研究该问题,以统计模型检验分析。基于Mesa与统计模型检验器MultiVeStA的集成,我们用混合种群扩展经典Schelling隔离模型:普通智能体用标准符号规则对邻居分类,而一个智能体经工具调用把该任务委托给LLM。LLM使能的智能体接收邻居的自然语言描述,调用工具递增相似/不同邻居计数器;这些计数器按原Schelling动力学决定其满意度。这提供了一个最小但受控的设定,可在其他方面标准的ABM内研究基于LLM决策的语义、操作与计算行为。我们报告对本地部署的不同规模LLM的初步实验:较小模型可能无法通过简单的语义分类实验,或在反复工具调用生成中变得操作上不可用;受测的较大模型通过这些初步检查。我们讨论统计模型检验如何估计经典ABM观测量,并量化在仿真模型中引入智能体化LLM组件的影响。

迈向智能体化的基于智能体模型:可行性、性能与统计模型检验:论文配图
图 1:统计模型检查结果和 t 检验