论文
思考的价格:更多推理未稳定改善 LLM 交易净收益
The Price of Thought: Does Test-Time Reasoning Pay in LLM Trading?
摘要
虽然大型语言模型 (LLM) 中的推理时间推理有望做出更好的决策,但其较高的计算成本可能不会产生更好的经济结果。然而,推理控制很少被评估为经济干预,其中模型输出的变化必须转化为扣除交易成本后更好的投资组合。我们对来自 DeepSeek、GPT 和 Gemini 系列的代表性大语言模型进行了一项对照研究。我们改变推理强度,同时保留每个形成日期可用的信息、提示、输出格式和固定的投资组合构建。我们的评估涵盖了三种输入条件下的全年美国股市:数字、可识别新闻和掩盖新闻。它包括超过 800,000 个资产预测和重复的模型生成。在所有三个模型系列中,额外的推理不会对投资组合净回报产生可靠的改善。对于 DeepSeek,我们检查从无推理到最大推理的完整进程,性能是非单调的。即使总体得分保持相似,重复生成也会产生不稳定的干预效果和投资组合选择。这些发现表明,额外的推理可以改变财务决策,而不会可靠地提高其经济价值,从而促使在部署之前对每项任务进行验证。
