论文

AI交易:评估大语言模型进行技术市场分析

AI Trading: Evaluating Large Language Models for Technical Market Analysis

模型评测模型能力评测

摘要

大语言模型 (LLM) 已成为处理现代金融市场异构信息环境的强大工具。本文对五个著名的 LLM:GPT-4 Turbo、Claude 3 Opus、Gemini 1.5 Pro、Llama 3 70B 和领域专业 FinGPT 的技术市场分析能力进行了系统的比较评估。该评估涵盖四个结构化任务:从 OHLCV 数据中识别烛台模式、生成定向信号(买入/卖出/持有)、通过模拟执行管道对信号质量进行回溯测试以及财务报告理解。我们的实验框架采用严格的定量指标,包括夏普比率、最大回撤、索提诺比率、信息系数、F1 分数和 BLEU 分数。模拟回测结果表明,GPT-4 Turbo 在通用模型中实现了最高的年化回报率和夏普比率,而 FinGPT 由于特定领域的 微调 而表现出具有竞争力的风险调整性能。在测试条件下,这两种模型的表现均优于被动 S&P 500 基准。该研究确定了所有评估模型中的持续失效模式,包括数字幻觉、上下文窗口限制以及横盘市场制度中的不一致表现。我们的结论是,虽然 LLM 在人工智能交易系统中具有真正的前景,但稳健的部署需要仔细的任务分解、严格的回测协议和领域感知的 微调 策略。