论文

TEC:解决问题的人类试错轨迹的集合

TEC: A Collection of Human Trial-and-error Trajectories for Problem Solving

模型评测基准与评测资源

摘要

试错是人类解决复杂问题的基本策略,也是人工智能(AI)系统在现实环境中运行的必备能力。尽管最近提出了几种试错人工智能技术,但大多数都依赖于研究人员设计的简单启发式方法,并且获得的性能提升有限。核心问题是缺乏适当的数据:当前的模型无法从人类在实践中实际如何进行试错的详细记录中学习。为了解决这一差距,我们引入了一个数据注释平台和相应的数据集,称为试错收集(TEC)。平台会记录用户在多次试验中的完整轨迹,并在收到错误反馈后收集用户的反馈。使用这个平台,我们记录了 46 名参与者在 58 项任务上解决问题的过程,在 41,229 个网页上产生了 5,370 条试验轨迹以及错误反映。通过这个数据集,我们观察到,与 LLM 相比,人类获得了更高的准确度,这表明人类在试错方面比 LLM 更有效。我们相信 TEC 平台和数据集为理解人类试错行为和开发更强大的人工智能系统提供了宝贵的基础。平台和数据集是公开的。