论文
可解释交易的多代理辩论:模拟市场中的推理、共识和表现
Multi-Agent Debate for Explainable Trading: Reasoning, Consensus, and Performance in Simulated Markets
摘要
大型语言模型 (LLM) 越来越多地用于金融决策,但尚不清楚推理质量的提高是否会转化为更好的经济成果。我们使用历史市场模拟中的投资组合分配多主体辩论框架来研究这个问题,其中专门的主体提出、批评和修改投资决策。推理质量从四个维度进行评估:逻辑有效性、证据支持、替代考虑和因果一致性,并与下游财务绩效进行比较。在 210 次受控运行中,总体推理质量与夏普比率(r = 0.07,p = 0.29)或总回报(r = 0.03,p = 0.70)没有有意义的关系。结构化提示将测量推理质量从约 0.72 提高到 0.84(+17.7%,Cohen's d 约 2.0),但这些收益并不能始终转化为更高的回报。我们将阿谀奉承的趋同视为一种主要的失败模式,即代理人在批评-修订周期中放弃独立立场,并趋向于类似的分配。保留分歧的 Jensen-Shannon 分歧干预将 Sharpe 提高了 +0.14 (p = 0.028),将 Sortino 提高了 +0.25 (p = 0.026),而强制执行更强的因果推理的干预措施不会改善财务绩效。我们的结果表明,当多智能体辩论保留独立的信息信号而不是简单地提高测量的推理质量时,它是最有价值的。