论文

RetailAgent:自条件化多模态大语言模型交易智能体中的结构性不利择时

RetailAgent: Structured Adverse Timing in Self-Conditioned Multimodal LLM Trading Agents

模型评测模型行为与机制分析

摘要

在金融市场中,对价格变动做出系统性反应的连续政策可能会被其他市场参与者预测到。本文通过 RetailAgent 研究大语言模型 (LLM) 代理是否表现出这种方向性结构,RetailAgent 是一个实验框架,其中 LLM 观察匿名盘中股票价格历史和允许状态,然后在显示后续区间收益之前反复选择多头(持有股票)或持平(退出)。在去除长期决策的总体比例后,我们比较了同一股票日内路径上长期和平区间的回报。这种暴露匹配的衡量标准揭示了跨模式、视野、状态和模型系列的持续负面时序。打乱已保存的动作序列会大大削弱效果,这表明动作和后续返回之间的一致性会导致负分。将自己创作的记忆纳入决策进一步提高了政策的持久性,而在代理人使用这两种行动的股票日中,时机变得更加消极。这些结果揭示了连续LLM财务决策中稳定、可恢复的方向结构,以及用于研究其他参与者如何响应可预测政策的行为信号。

RetailAgent:自条件化多模态大语言模型交易智能体中的结构性不利择时:论文配图
图1:顶级:价格限制行为可能要求互动市场作出反反应。底部:零售商分离出其中一项决策政策,从允许的状态中选择二进制行动,并根据随后披露的回报进行评估。