论文
LLM 交易代理中的表示签名和风险反馈对齐
Representation Signatures and Risk-Feedback Alignment in LLM Trading Agents
摘要
我们研究金融决策环境中 大语言模型 (LLM) 代理的行为调整和表征动态。 TradeArena 是一个可审计的交易代理测试平台,具有风险报告、执行模拟、内存和可重播轨迹,让我们能够分析在市场压力下原理、头寸和干预措施如何演变。代码和数据工件可通过 \href{https://github.com/weich97/TreLLM-public}{TradeArena 存储库} 获取。我们发现了故障前的特征:规划嵌入偏离正常质心,融合的计划风险表示将正常状态与预缩减状态分开,局部流形表现出有效秩收缩。在 80 个滚动故障锚点和 8 个 LLM 轨迹中,这种模式在哈希、LSA、Transformer 和白盒隐藏状态探测器中持续存在。使用无 CoT 目标权重、词汇控制、OHLCV 噪声和错误审计的压力测试表明,基本原理层面的收缩可能会在没有基本原理的情况下消失,而意图空间和融合签名仍然提供信息。结构化风险反馈可以在没有 微调 的情况下充当外部对齐信号,但不能作为通用性能增强器:真实的审计反馈可以改善某些模型的校准、其他模型的回报,并揭示安慰剂或隐藏反馈具有较高短期回报但对齐诊断较弱的情况。 51 只股票的盘中实验揭示了一个相关性盲点:LLM 的基本原理证明了风险层削减的耦合资产的敞口是合理的。最后,财务审计任务套件将比较从“哪个模型交易最好”转移到模型是否可以审计轨迹、尊重执行边界、重现工件并避免索赔过度。这些结果支持研究主张,而不是盈利能力主张:可审计的风险反馈和代表性轨迹揭示了 LLM 财务推理何时调整、漂移或失败。