评估LLM投资逻辑:面向个性化金融Agent的现实基准
Evaluating Investment Logic in Large Language Models: A Real-World Benchmark Towards Personalzied Financial Agents
摘要
投资能力本质上是个性化的:对于投资者而言,相同的市场证据可能适用于不同目标、时间框架、投资组合和风险边界。然而,金融LLMs(语言模型)通常仅通过静态问答或最终利润与损失来评估,前者忽略了代理关系;后者无法揭示是否盈利行动基于收益、行为一致性还是偶然的。我们询问社区是否正在使用错误的尺子来评价后果性的代理。我们引入了\textsc{InvestLogicBench},这是一个包含151名真实投资者的201,247个文档决策的过程化基准。每个回合都实例化了一个P$\rightarrow$E$\rightarrow$R$\rightarrow$D$\rightarrow$O轨迹:投资者的Profile(特征)、可观察的市场事件、投资理由、执行的Decision(行动)和延迟的Outcome(结果)。公开还包括Profile构建、点时间事件绑定、结构化的逻辑、时间框架、结果以及后评估,支持理解、基于Profile条件生成和端到端重放。在四大领先LLMs中,逻辑合理性接近4/5,但事件基础性仅0.8-2.8/5;回报与过程质量也存在分歧。这些结果暴露了经过修饰但缺乏根基的推理,最终评估隐藏了结果。我们进一步认为P$\rightarrow$E$\rightarrow$R$\rightarrow$D$\rightarrow$O应该是一个数据系统接口,要求版本化的Profile、时间证明、可检查的检索、决策日志和可重放的结果。金融是我们对更广泛的一类个性化、后果性代理进行压力测试的机会。
