论文
智能体开发在多大程度上反映真实世界的工作?
How Well Does Agent Development Reflect Real-World Work?
摘要
AI 智能体越来越多地在与人类工作相关的基准上进行开发和评估,但这些基准化工作在多大程度上能代表整个劳动力市场,目前仍不清楚。在这项工作中,我们通过将基准任务实例映射到工作领域与技能,系统研究智能体开发投入与现实世界人类工作分布之间的关系。我们首先分析了 43 个基准和 72,342 个任务,衡量它们与美国劳动力市场全部 1,016 种真实职业中人类就业和资本配置的匹配程度。我们揭示了以编程为中心的智能体开发与人类劳动和经济价值集中类别之间的显著错配。在智能体目前瞄准的工作领域内,我们进一步通过测量其自主性水平来刻画当前智能体的效用,为不同工作场景下的智能体交互策略提供实用指导。基于这些发现,我们提出三条可度量的原则,用于设计能更好捕捉社会上重要且技术上具挑战性工作形式的基准:覆盖率、真实性和细粒度评估。
