论文
LiveMACE:动态市场中面向执行过程的Agent评测
LiveMACE: Process-Aware Evaluation of LLM Agent Capabilities in Evolving Markets
摘要
只根据结果评测Agent,可能掩盖产生结果的实际能力。在不断变化的环境中,这个问题尤为突出,因为结果来自Agent行为与外部条件之间的闭环交互。我们提出LiveMACEBench,一个关注执行过程的基准,使用真实金融市场作为持续运行LLM Agent的自然变化环境。五个前沿LLM在工具使用、持久记忆、规则遵循和多Agent协作配置相匹配的条件下,沿连续轨迹运行。评测既使用实际产生的结果,也使用从完整决策轨迹中提取的机制诊断指标。在30天实时评测中,我们发现显著的结果与能力差距:实际收益经常与具体能力指标不一致,相近收益也可能来自截然不同的机制使用方式。轨迹级诊断进一步揭示各项能力的不同瓶颈,表明“可以使用某种机制”“有效使用该机制”和“最终任务表现”不能互相替代来衡量Agent能力。LiveMACEBench使这种区分可以被测量,将实时市场从收益排行榜转为诊断Agent能力的环境。
