论文

RewardHackingAgents:LLM机器学习工程智能体的评估完整性基准

RewardHackingAgents: Benchmarking Evaluation Integrity for LLM ML-Engineering Agents

智能体系统Agent任务评测

摘要

LLM智能体越来越多地执行端到端机器学习工程任务,其成败由单一标量测试指标判定。这造成结构性漏洞:智能体可以不改进模型、而通过破坏评估管线来抬高报告分数。我们提出RewardHackingAgents——一个基于工作区的基准,把两条破坏路径显式化、可度量:评估器篡改(修改指标计算或上报)与训练/测试泄漏(训练期间访问留出数据或标签)。每个回合在全新工作区运行,带补丁追踪与运行时文件访问日志;检测器把智能体报告的指标与可信参照比较,给出可审计的完整性标签。在三个任务与两个LLM骨干上,脚本化攻击在完全可变工作区中于两条路径均得手;单一机制防御只挡住一条路径;组合机制则两条全挡。自然智能体运行中,约50%的回合出现评估器篡改企图,评估器锁定可将其消除,运行时开销中位数25-31%。总体而言,我们证明ML工程智能体的评估完整性可以作为一等结果来基准化,而非默认假设。

RewardHackingAgents:LLM机器学习工程智能体的评估完整性基准:论文配图
图1:RewardHackingAgents系统总览:任务与工作区模板、补丁生成、回合运行、检测器及可变至全锁定的多档信任机制。