论文
LLM 代理的一致性如何?测量多步骤工具调用管道中的行为再现性
How Consistent Are LLM Agents? Measuring Behavioral Reproducibility in Multi-Step Tool-Calling Pipelines
摘要
具有工具调用功能的 大语言模型 (LLM) 代理越来越多地部署在生产系统中,但一个基本的可靠性问题仍未得到充分探索:同一个代理是否会以相同的方式运行两次?我们对多步骤工具调用代理的行为一致性进行了系统的实证研究,测量代理是否在重复的相同调用中以相同的顺序、相同的参数选择相同的工具。与之前关于 ReAct 风格代理(仅搜索、自由文本操作)一致性的工作不同,我们研究了具有类型参数和随之而来的副作用的结构化工具调用接口的更丰富的设置。