论文
RetailBench:评估LLM智能体在真实零售环境中的长程自主决策与策略稳定性
RetailBench: Evaluating Long-Horizon Autonomous Decision-Making and Strategy Stability of LLM Agents in Realistic Retail Environments
摘要
基于大语言模型(LLM)的智能体在短期和高度结构化的任务上取得了显着的成功。然而,他们在现实和动态环境中长期保持一致决策的能力仍然是一个公开的挑战。我们推出了 RetailBench,这是一个高保真基准,旨在评估现实商业场景中的长期自主决策,其中代理商必须在随机需求和不断变化的外部条件下运作。我们进一步提出了不断发展的战略和执行框架,它将高层战略推理与低层行动执行分开。这种设计能够随着时间的推移实现自适应且可解释的策略演变。这对于长期任务尤其重要,其中非平稳环境和错误累积需要在与行动执行不同的时间尺度上修改策略。在日益具有挑战性的环境中对八个最先进的大语言模型进行的实验表明,与其他基线相比,我们的框架提高了操作稳定性和效率。然而,随着任务复杂性的增加,性能会大幅下降,揭示了当前大语言模型在长期、多因素决策方面的根本局限性。