论文

SHARP:针对金融交易代理的自我演化、可人工审计的规则政策

SHARP: A Self-Evolving Human-Auditable Rubric Policy for Financial Trading Agents

智能体系统Agent 规划

摘要

大语言模型 (LLM) 越来越多地部署用于自主金融交易,这是一个需要不断适应嘈杂、非平稳市场的领域。现有的自我改进代理通常通过无限制的自由形式提示优化来解决这个问题。然而,在具有延迟标量奖励(P\&L)的低信噪比环境中,这种非结构化方法加剧了基本的贡献分配问题:优化器无法可靠地区分系统逻辑缺陷和随机市场方差,不可避免地导致政策漂移。为了克服这一瓶颈,我们引入了自我进化的人类可审计规则策略(SHARP),这是一种神经符号框架,用结构化的符号策略优化取代无约束的文本突变。 SHARP 将智能体的推理限制在有界的、人类可读的明确条件-动作规则的范围内。当发生次优交易时,归因代理会在多个样本之间采用跨样本推理来隔离特定的规则失败。这使得能够进行有针对性的原子策略编辑,随后通过严格的前向验证进行规范化。通过对三个不同的股票部门和四个 LLM 主干网进行评估,SHARP 始终如一地将通用初始启发法转化为高度稳健的策略,将紧凑模型的经验性能平均提高了 10 至 20 个百分点(例如 GPT-4o-mini)。最终,SHARP 证明了 LLM 可以实现动态、高效的适应,同时显着提高机构融资所需的结构透明度和可审计性。