交易Agent在生产中实际做什么:两个群体的六个月记录
What LLM Trading Agents Actually Do in Production: A Six-Month, Population-Scale Record from Two Fleets
摘要
我们提供了在生产环境中运行的自主语言模型交易智能体的连续人口规模测量记录,具有同一个设计血统:DX Terminal Pro(2026 年 2 月至 3 月,3,505 个用户资助的金库在 Base memecoin 市场上交易真实 ETH,为期 21 天,即 2026 年 2 月至 3 月)和 DXAP live alpha 队列(历史上有 500 至 599 个用户创建的智能体,91 至 117 个同时活跃的交易 Hyperliquid)永久,2026 年 6 月至 8 月)。该记录持续了大约六个月,单模型调用次数为 750 万次,链上操作约为 30 万次,另外 231,638 次多工具轮次产生了 14,596 次填充。该论文有四项发现。首先,操作层比策略文本中编写的任何内容都更能决定行为:风险滑块解释杠杆(每级 +0.425),智能体固定效应吸收 60% 的方差,排行榜渲染边界因果路由选择(前 3 切的回归不连续性 1.75 倍)。其次,规模调整是波动性盲的:每个波动性六分相中的杠杆中位数为 5.0 倍,一个姿势滑块单元(账簿的 11%)持有 62% 的清算。第三,智能体商几乎没有捕捉到他们所达到的上涨空间:43.2%的头寸在24小时内出现至少+300个基点的有利波动,但其中49.3%的头寸以负交易回报结束;机械支架每个位置恢复+39.0 bps。第四,两支舰队都没有表现出方向性优势。 DXAP 机队没有盈利,并且落后于 Hyperliquid 零售基准(41% 对比 50% 往返赢率)。对 416 个捕获的生产场景进行的配对重放前沿模型联盟发现,在此范围内,决策质量在统计上无法区分,而不同模型系列的选择稳定性却存在巨大差异。每个标题都经受住了日聚集推理、零排列和普通费用重述;本文以 17 条规则的方法论作为结尾,我们自己也撤回了这一原则。
