论文

LiveMACE:动态市场中面向执行过程的Agent评测

LiveMACE: Process-Aware Evaluation of LLM Agent Capabilities in Evolving Markets

智能体系统上下文与知识记忆Agent 协作Agent任务评测

摘要

只根据结果评测Agent,可能掩盖产生结果的实际能力。在不断变化的环境中,这个问题尤为突出,因为结果来自Agent行为与外部条件之间的闭环交互。我们提出LiveMACEBench,一个关注执行过程的基准,使用真实金融市场作为持续运行LLM Agent的自然变化环境。五个前沿LLM在工具使用、持久记忆、规则遵循和多Agent协作配置相匹配的条件下,沿连续轨迹运行。评测既使用实际产生的结果,也使用从完整决策轨迹中提取的机制诊断指标。在30天实时评测中,我们发现显著的结果与能力差距:实际收益经常与具体能力指标不一致,相近收益也可能来自截然不同的机制使用方式。轨迹级诊断进一步揭示各项能力的不同瓶颈,表明“可以使用某种机制”“有效使用该机制”和“最终任务表现”不能互相替代来衡量Agent能力。LiveMACEBench使这种区分可以被测量,将实时市场从收益排行榜转为诊断Agent能力的环境。

LiveMACE:动态市场中面向执行过程的Agent评测:论文原图
图2:共享市场环境下的能力评估。 (a) 相同工具使用账户的每日累计收益和工具调用分数(TCS)排名。等级1最高;注释计算可比对之间的成对逆转。 (b) 全周期 TCS、内存使用质量 (MUQ)、规则满意度得分 (RSS) 和可观察协作得分 (OCS),全部在 [0,1][0,1] 上。颜色识别型号;粗体标记每个维度的最高分数,破折号表示不可用的分数。其他维度的排名如附录 C.7 所示。