论文

CLQT:面向LLM组合管理智能体诊断评估的闭环成本感知策略一致基准

CLQT: A Closed-Loop, Cost-Aware, Strategy-Consistent Benchmark for Diagnostic Evaluation of LLM Portfolio-Management Agents

智能体系统智能体互操作协议Agent任务评测MCP

摘要

大语言模型代理人越来越多地被塑造为自主投资组合经理,基准已经从金融问答转向顺序交易。然而,大多数人仍然根据固定窗口内的回报对代理商进行排名,这是一个弱代理:市场路径主导着一段时间的回报,一旦控制了前瞻泄漏,明显的阿尔法就会消失。我们引入了 CLQT,它将闭环交易评估重新构建为排名前的诊断:一种定位代理流程成功或失败的位置和原因的工具。 CLQT 是一个闭环、成本感知、策略一致、时间门控的环境,其代理运行五个阶段的循环:收集、综合、分配、执行、反映。每轮都会发出一个密封到可重新计算验证的哈希链中的 DecisionRound。六个支柱构成了基础:TimeGate、交易和融资成本建模、策略一致性评分、三层内存、模型上下文协议工具层和任务感知综合。同一代理运行结构化或完全自主,使流程脚手架成为实验变量。根据审计跟踪,我们计算出五轴能力记分卡(APM-CS:连贯性、敏锐性、冷静、纪律、可靠性),连贯性部分由坚持不懈的、非同类大语言模型来评判。我们在污染控制的多模型回测中验证了 CLQT,该回测使用消融网格和实时代理跟踪,对看不见的截止后数据进行跟踪,并针对重复运行的本底噪声进行验证。三个发现说明了诊断优先的解读:能力领先者不是夏普领先者(名义上的获胜者是 26 轮中的 5 轮可靠性工件);信号-动作一致性在两个赛道上都以稳定的幅度超过了坚持不懈的法官的连贯性分数(+0.30 回测,+0.23 实时);当返回时,功能轴上的模块值寄存器无法将其分开。 CLQT 产生的不是模型排名,而是持久的、可扩展的代理能力和限制图。