论文

使用带有闭环强化学习反馈的 大语言模型 法官对代理股票预测系统进行多维行为评估

Multi-Dimensional Behavioral Evaluation of Agentic Stock Prediction Systems Using Large Language Model Judges with Closed-Loop Reinforcement Learning Feedback

智能体系统Agent任务评测

摘要

代理人工智能系统通过一系列相互依赖的自主决策产生输出,但标准评估仅评估输出,无法诊断底层过程。我们开发了一种行为评估方法,通过对中间决策过程本身进行评分来补充输出水平测试。在每个自主决策点记录的行为轨迹被分为五天的片段,并由三名 大语言模型 (LLM) 法官组成的团队沿着六个特定领域维度(制度检测、路由、适应、风险校准、策略一致性、错误恢复)进行评分。扰动过程会破坏一个维度,同时保持其他五个维度不变,从而证实了维度特异性;跨模型一致性达到 Krippendorff 的 alpha = 0.85。综合行为评分与已实现的 20 天夏普比率相关(Spearman rho = 0.72)。关闭循环后,该框架将不足的每维度分数转换为信用分配的惩罚,添加到软演员评论家奖励中。仅限于验证数据的三个 微调 周期在 2017 年至 2025 年测试期间将一日 MAPE 从 0.61% 降低至 0.54%(11.5% 相对值;p<0.001,d=0.31),在 Diebold-Mariano 下显着,并由 Giacomini-White 定位到高波动性状态。该方法与应用程序无关,适用于可以记录中间决策的任何代理系统。