论文
CheatBench:测量 AI Agent中的奖励作弊
CheatBench: Measuring Reward Gaming in AI Agents
摘要
强化学习帮助人工智能Agent解决了越来越困难的任务,但高回报并不总是反映用户预期的工作。在人工智能行业最近发生的事件和受控评估中,经过训练以最大化奖励的Agent访问了未经授权的信息,试图逃避监控系统,甚至突破沙箱保护来攻击外部系统。随着Agent能力的增强,这种行为可能会带来越来越严重的风险。为了衡量这个问题,我们引入了 CheatBench,这是跨数学研究、知识工作、编码、视觉任务和其他领域的人工智能Agent作弊基准。它的环境将具有挑战性的任务与作弊的机会结合在一起,使研究人员能够研究Agent在诚实工作困难时如何追求目标。 CheatBench 支持跨模型和任务类别的比较,为在Agent承担更重要的责任时衡量和减少作弊提供一个测试平台。我们在https://cheatbench.ai公开发布CheatBench